Proliferarea rapidă a sistemelor de inteligență artificială (AI) în domenii critice—diagnostic medical, evaluarea riscurilor financiare, conducerea autonomă și administrația publică—a evidențiat o nevoie urgentă de explicabilitate a modelelor. Deși modelele de învățare automată (ML) cu performanțe ridicate, în special rețelele neuronale profunde, obțin o acuratețe remarcabilă, opacitatea lor ridică provocări semnificative în aplicațiile cu risc ridicat, unde responsabilitatea, încrederea și conformitatea reglementară sunt esențiale. La CELSO DATA SCIENCE, am întâlnit această provocare direct în proiecte precum Asistentul Virtual Public Universal (UVPA) dezvoltat pentru Primăria București, unde deciziile bazate pe AI trebuie să fie transparente atât pentru cetățeni, cât și pentru administratori. Explicabilitatea nu este doar un detaliu tehnic; este o cerință fundamentală pentru implementarea etică a AI, permițând părților interesate să valideze predicțiile, să detecteze prejudecățile și să asigure alinierea cu cadrele legale precum Legea UE privind AI și GDPR. Fără mecanisme robuste de explicabilitate, chiar și cele mai precise modele riscă respingerea din cauza naturii lor de “cutie neagră”, subminând utilitatea lor în lumea reală.

Dihotomia dintre modelele cutie neagră și cutie albă encapsulează compromisul central din AI-ul modern: performanță versus interpretabilitate. Modelele de tip cutie neagră, cum ar fi rețelele neuronale profunde, copacii de decizie îmbunătățiți cu gradient (de ex., XGBoost, LightGBM) și modelele de limbaj mare (LLM), excellează în capturarea relațiilor complexe, neliniare din date, dar funcționează ca aproximatori de funcții insondabile. De exemplu, în lucrul nostru la sistemele de întreținere predictivă pentru TASSID, un model ajustat pe Mistral Large a obținut o îmbunătățire de 35% a ratei de rezolvare la prima intervenție pentru defecțiunile echipamentelor de refrigerare. Cu toate acestea, procesul său intern de luare a deciziilor a rămas opac, ridicând îngrijorări printre tehnicieni, care trebuiau să aibă încredere în recomandările sistemului. În schimb, modelele de tip cutie albă—cum ar fi regresia liniară, copacii de decizie sau rețelele bayesiene—oferă interpretabilitate inerentă, dar adesea sacrifică puterea predictivă. Într-un proiect de compilare a 55 de cataloage online cu peste 15.000 de produse fiecare, am folosit inițial copaci de decizie pentru a categorisi articolele pe baza metadatelor. Deși regulile erau ușor de înțeles, acuratețea modelului a stagnat la 82%, mult sub 94% obținut de un ansamblu LightGBM. Acest compromis necesită abordări hibride, cum ar fi distilarea modelelor sau tehnici de explicabilitate post-hoc, pentru a acoperi decalajul dintre performanță și transparență.

Printre cele mai utilizate metode de explicabilitate post-hoc se numără SHAP (SHapley Additive exPlanations), un cadru bazat pe teoria jocurilor cooperative. SHAP atribuie fiecărei caracteristici un scor de contribuție la predicția modelului prin calcularea valorii Shapley, care cuantifică contribuția marginală a caracteristicii în toate combinațiile posibile de caracteristici. Spre deosebire de metode mai simple, cum ar fi importanța prin permutare, SHAP ia în considerare interacțiunile dintre caracteristici și oferă interpretabilitate locală—explicând predicțiile individuale—în timp ce permite și interpretabilitate globală prin agregare. În platforma noastră eDezvoltator.ro, care agregă date despre 40.000 de unități rezidențiale, SHAP a fost esențial pentru explicarea evaluării proprietăților de către model. De exemplu, modelul a atribuit valori SHAP ridicate pentru “proximitatea stațiilor de metrou” în zonele urbane, dar valori scăzute în regiunile suburbane, dezvăluind un efect de interacțiune dependent de context. Implementarea SHAP în Python este simplă folosind biblioteca `shap`, dar eficiența computțională variază: TreeSHAP (optimizat pentru modele bazate pe copaci) rulează în timp polinomial, în timp ce KernelSHAP (agnostic la model) nu scalează bine cu date de înaltă dimensionalitate. În practică, combinăm adesea SHAP cu Graficele de Dependence Parțială (PDP) pentru a vizualiza cum efectul marginal al unei caracteristici se schimbă pe distribuția sa, oferind o înțelegere mai intuitivă a relațiilor neliniare.

LIME (Local Interpretable Model-agnostic Explanations) oferă o abordare alternativă, aproximând local comportamentul unui model complex folosind un model surogat mai simplu și interpretabil. LIME perturbează datele de intrare în jurul unei instanțe specifice și antrenează un model liniar sau un copac de decizie pe eșantioanele perturbate, ponderate în funcție de proximitatea față de instanța originală. Această metodă este deosebit de utilă pentru date de înaltă dimensionalitate, cum ar fi imagini sau text, unde costul computțional al SHAP devine prohibitiv. În platforma noastră Transfăgărășan.Travel, care procesează interogări ale utilizatorilor în patru limbi, LIME a ajutat la explicarea motivului pentru care anumite atracții erau recomandate în detrimentul altora. De exemplu, un utilizator care căuta “drumetii prietenoase familiei” a primit recomandări bazate pe caracteristici precum “dificultatea traseului” și “proximitatea parcurilor de joacă”, LIME evidențiind ultima ca factor decisiv. Cu toate acestea, dependența LIME de perturbațiile locale introduce instabilitate—rulări diferite pot produce explicații diferite pentru aceeași instanță. Pentru a atenua acest lucru, folosim metrici de stabilitate și validăm în cruce explicațiile pe multiple perturbații. LIME este, de asemenea, mai puțin eficient pentru date rare, unde perturbațiile pot genera eșantioane nerealiste, o limitare pe care am întâlnit-o la explicarea sistemului de scorare comportamentală din platforma ASPA.

Analiza importanței caracteristicilor reprezintă piatra de temelie a interpretabilității modelului, distingând între tehnicile globale și locale. Metodele globale, cum ar fi importanța prin permutare sau importanța Gini (pentru modelele bazate pe copaci), clasifică caracteristicile în funcție de impactul lor general asupra performanței modelului. În sistemul nostru CRM pentru TASSID, importanța prin permutare a relevat că “istoricul serviciilor” și “vârsta echipamentului” erau principalii predictori ai nevoilor de întreținere, ghidând strategia companiei de stocare a inventarului. Metodele locale, cum ar fi SHAP sau LIME, se concentrează pe predicțiile individuale, explicând de ce un anumit echipament a fost marcat pentru defectare. Cu toate acestea, importanța globală poate fi înșelătoare atunci când caracteristicile sunt corelate. De exemplu, în catalogul CaseBineFacute.ro de locuințe, “suprafața utilă” și “numărul de camere” erau puternic corelate, ducând la clasamente instabile de importanță. Pentru a aborda acest lucru, folosim importanța prin permutare condiționată, care ia în considerare dependențele dintre caracteristici, sau clustering ierarhic pentru a grupa caracteristicile corelate înainte de analiză. O altă provocare apare cu caracteristicile categorice cu multe niveluri, cum ar fi “cartierul” în datele imobiliare. Aici, folosim codificare țintă sau straturi de încorporare pentru a reduce dimensionalitatea înainte de calcularea scorurilor de importanță.

Graficele de Dependence Parțială (PDP) și Graficele de Așteptare Condiționată Individuală (ICE) oferă instrumente complementare pentru vizualizarea efectelor caracteristicilor. PDP-urile arată efectul marginal mediu al unei caracteristici asupra predicției modelului, în timp ce ICE-urile descompun acest efect în traiectorii individuale pentru fiecare instanță. În sistemul nostru de întreținere predictivă pentru TASSID, PDP-urile au dezvăluit o relație neliniară între “temperatura de funcționare” și probabilitatea de defectare: riscul crește brusc peste 8°C, dar se stabilizează sub -5°C. ICE-urile, însă, au arătat că această relație varia în funcție de tipul de echipament—unele modele erau mai sensibile la temperaturile scăzute. PDP-urile presupun independența caracteristicilor, ceea ce poate duce la scenarii nerealiste (de ex., reprezentarea “turației motorului” față de “viteza vehiculului” fără a ține cont de rapoartele de viteze). Pentru a atenua acest lucru, folosim Graficele Efectelor Locale Acumulate (ALE), care calculează efectele în cadrul distribuțiilor condiționale ale caracteristicilor. Pentru date de înaltă dimensionalitate, combinăm PDP-urile cu tehnici de reducere a dimensionalității, cum ar fi PCA sau t-SNE, pentru a vizualiza interacțiunile dintre mai multe caracteristici simultan.

Explicațiile contrafactuale abordează o întrebare critică în AI explicabil: “Ce ar trebui să se schimbe pentru ca modelul să genereze un rezultat diferit?” Aceste explicații generează perturbații minime la intrare care inversează predicția modelului, oferind informații acționabile pentru utilizatorii finali. De exemplu, în sistemul UVPA pentru Primăria București, un cetățean căruia i s-a refuzat o autorizație de construcție ar putea primi o explicație contrafactuală de genul: “Dacă proprietatea dvs. ar fi la 50 de metri distanță de zona inundabilă, autorizația ar fi fost aprobată.” Implementăm contrafactualele folosind tehnici de optimizare, cum ar fi metodele bazate pe gradient pentru modele diferențiabile sau algoritmi genetici pentru modelele de tip cutie neagră. Cu toate acestea, generarea de contrafactuale realiste nu este trivială. În modelul nostru de evaluare imobiliară, un contrafactual care sugerează “creșterea numărului de băi de la 1 la 3” ar putea fi valid matematic, dar impracticabil. Pentru a asigura plausibilitatea, restricționăm perturbațiile folosind reguli specifice domeniului (de ex., “un apartament cu 2 dormitoare nu poate avea 4 băi”) sau modele generative antrenate pe distribuții de date din lumea reală. O altă provocare este diversitatea—furnizarea mai multor contrafactuale distincte pentru a evita inducerea în eroare a utilizatorilor. Abordăm acest lucru folosind funcții de pierdere care promovează diversitatea sau abordări bazate pe clustering pentru a genera un set reprezentativ de contrafactuale.

Explicațiile bazate pe reguli extrag reguli de decizie ușor de înțeles din modele complexe, făcând podul între performanța modelelor de tip cutie neagră și interpretabilitatea celor de tip cutie albă. Tehnici precum copacii de decizie, listele de reguli sau seturile de reguli bayesiene pot fi antrenate direct sau distilate din modele mai complexe. În platforma noastră ASPA pentru adăposturi de animale, am folosit o listă de reguli pentru a explica sistemul de scorare comportamentală, generând reguli precum “DACĂ (nivel_energie = ridicat) ȘI (scor_agresivitate < 3) ATUNCI (potrivit_pentru_familii = Adevărat)." Aceste reguli au fost derivate dintr-un model îmbunătățit cu gradient folosind Liste de Reguli Bayesiene (BRL), care optimizează atât acuratețea, cât și simplitatea. Pentru modelele de învățare profundă, folosim integrare neuro-simbolică, unde predicțiile unei rețele neuronale sunt mapate la reguli logice folosind tehnici precum Mașini Logice Neuronale (NLM). Cu toate acestea, extragerea regulilor sacrifică adesea fidelitatea—regulile extrase pot să nu replice perfect comportamentul modelului original. Pentru a cuantifica acest lucru, calculăm metrici de fidelitate, cum ar fi rata de acord între modelul original și modelul surogat bazat pe reguli. În aplicații cu risc ridicat, cum ar fi UVPA, combinăm explicațiile bazate pe reguli cu valorile SHAP pentru a oferi atât reguli de nivel înalt, cât și contribuții detaliate ale caracteristicilor.

Mecanismele de atenție din învățarea profundă au devenit un instrument puternic pentru interpretabilitate, în special în procesarea limbajului natural (NLP) și viziunea computerizată. Inițial concepute pentru a îmbunătăți performanța modelului prin ponderarea dinamică a caracteristicilor de intrare, ponderile de atenție pot servi și ca explicații proxy pentru focalizarea modelului. În platforma noastră Transfăgărășan.Travel, care utilizează un model bazat pe transformatori pentru a genera itinerarii personalizate, ponderile de atenție au dezvăluit că modelul prioriza “popularitatea sezonieră” față de “preferințele utilizatorului” în lunile de vârf ale călătoriilor. Cu toate acestea, ponderile de atenție nu sunt întotdeauna explicații de încredere. Cercetările au arătat că atenția poate fi manipulată adversarial sau nealiniată cu importanța bazată pe gradient, ducând la interpretări înșelătoare. Pentru a valida explicațiile bazate pe atenție, le coroborăm cu metode bazate pe gradient, cum ar fi Gradienții Integrați sau Propagarea Relevanței pe Nivele (LRP). Pentru modelele de viziune, folosim Hartă de Activare a Clasei (CAM) sau variantele sale (de ex., Grad-CAM, Grad-CAM++) pentru a vizualiza care regiuni ale unei imagini influențează predicția. În sistemul nostru de diagnostic pentru TASSID, Grad-CAM a evidențiat bobinele compresorului ca cea mai relevantă regiune pentru detectarea scurgerilor de agent frigorific, aliniindu-se cu expertiza de domeniu.

Hărțile de saliență și tehnicile de vizualizare bazate pe gradient oferă o altă perspectivă pentru interpretarea modelelor de învățare profundă, în special în viziunea computerizată. Hărțile de saliență calculează gradientul ieșirii în raport cu intrarea, evidențiind pixelii care influențează cel mai mult predicția. Deși intuitive, hărțile de saliență sunt sensibile la perturbațiile intrării și pot produce explicații zgomotoase. Pentru a îmbunătăți robustețea, folosim smoothgrad, care mediează hărțile de saliență pe mai multe versiuni zgomotoase ale intrării, sau backpropagarea ghidată, care combină saliența cu deconvoluția pentru a suprima gradienții negativi. În pipeline-ul nostru de producție de website-uri industriale, unde generăm peste 100 de website-uri pe lună folosind agenți AI, hărțile de saliență au ajutat la depanarea unui model care clasifica ocazional greșit logo-urile companiilor de construcții ca “rezidențiale” în loc de “comerciale”. Hărțile au dezvăluit că modelul era prea sensibil la prezența copacilor în fundal, o prejudecată introdusă de datele de antrenament. Pentru o interpretabilitate mai profundă, folosim Propagarea Relevanței pe Nivele (LRP), care descompune predicția în contribuții de la fiecare neuron din rețea, propagând relevanța înapoi de la ieșire la intrare. LRP este deosebit de eficient pentru rețelele neuronale convoluționale profunde, unde poate atribui predicțiile unor filtre sau straturi specifice.

Gradienții Integrați (IG) abordează o limitare cheie a hărților de saliență: incapacitatea lor de a ține cont de intrarea de bază. IG calculează integrală gradienților de-a lungul căii de la o bază (de ex., o imagine neagră sau un vector zero) la intrare, asigurând că atribuirea este completă—suma atribuțiilor este egală cu diferența dintre ieșirea modelului pentru intrare și cea pentru bază. În modelul nostru de evaluare imobiliară, IG a dezvăluit că modelul atribuia o importanță disproporționată “anului construcției” pentru proprietățile construite înainte de 1980, o constatare care a determinat o revizuire a datelor de antrenament pentru potențiale prejudecăți. IG este intensiv din punct de vedere computțional, dar optimizări precum integrarea căii aproximative sau paralelizarea o fac fezabilă pentru utilizare în producție. Combinăm, de asemenea, IG cu explicații contrafactuale pentru a genera informații acționabile. De exemplu, un proprietar ar putea afla că “renovarea bucătăriei” ar crește evaluarea mai mult decât “adăugarea unui garaj”, pe baza atribuțiilor IG.

Ancora oferă explicații precise, agnostice la model, identificând submultimi minime de caracteristici care “ancorează” o predicție—schimbarea acestor caracteristici garantează că predicția rămâne aceeași, indiferent de valorile altor caracteristici. Spre deosebire de LIME sau SHAP, care oferă scoruri continue de importanță, ancora oferă explicații binare, asemănătoare regulilor, mai ușor de înțeles pentru utilizatorii non-tehnici. În platforma noastră ASPA, ancora a explicat de ce anumiți câini erau clasificați ca fiind “cu risc ridicat” de agresivitate, generând reguli precum “DACĂ (rasă = Pit Bull) ȘI (vârstă < 2 ani) ATUNCI (risc = ridicat)." Ancora este deosebit de utilă pentru date de înaltă dimensionalitate, unde aproximările liniare ale LIME pot eșua. Cu toate acestea, poate fi costisitoare din punct de vedere computțional, deoarece necesită explorarea spațiului de caracteristici pentru a găsi submultimi minime. Mitigăm acest lucru folosind căutare cu fascicul sau algoritmi genetici pentru a căuta eficient ancora. O altă limitare este acoperirea—ancora poate să nu existe pentru toate instanțele, în special în date rare sau zgomotoase. Pentru a aborda acest lucru, relaxăm cerința de precizie sau combinăm ancora cu alte metode, cum ar fi SHAP, pentru instanțele în care nu se găsește nicio ancora.

Copacii de decizie și listele de reguli reprezintă standardul de aur pentru modelele inerent interpretabile, oferind transparență fără a sacrifica performanța în multe cazuri de utilizare. Copacii de decizie împart recursiv spațiul caracteristicilor folosind diviziuni axiale, generând o structură asemănătoare unui fluxogramă care poate fi vizualizată și auditată. În sistemul nostru CRM pentru CELSO, un copac de decizie a fost folosit pentru a prioriza potențialii clienți, cu reguli precum “DACĂ (buget > 5000 EUR) ȘI (industrie = construcții) ATUNCI (prioritate = ridicată).” Deși copacii de decizie sunt interpretabili, sunt predispuși la supraîncărcare și instabilitate—mici schimbări în date pot duce la arbori complet diferiți. Pentru a îmbunătăți robustețea, folosim metode de ansamblu, cum ar fi Pădurea Aleatoare sau Copacii de Decizie Îmbunătățiți cu Gradient, care combină mai mulți copaci pentru a reduce varianța. Pentru aplicațiile care necesită o interpretabilitate și mai mare, folosim liste de reguli, cum ar fi Listele de Reguli Bayesiene (BRL) sau algoritmul OneR, care generează o singură listă de reguli de tip “dacă-atunci”. Aceste modele sunt deosebit de eficiente pentru seturi de date mici sau decizii cu risc ridicat, unde simplitatea este primordială. Cu toate acestea, performanța lor rămâne adesea în urmă față de modelele de tip cutie neagră, necesită un compromis între acuratețe și interpretabilitate.

Rețelele bayesiene oferă un cadru probabilistic pentru AI explicabil, modelând dependențele dintre caracteristici folosind grafuri aciclice orientate (DAG). Spre deosebire de copacii de decizie, care oferă reguli deterministe, rețelele bayesiene cuantifică incertitudinea și permit analiza “ce-ar-fi-dacă” prin inferență probabilistică. În sistemul nostru de întreținere predictivă pentru TASSID, o rețea bayesiană a modelat relațiile dintre citirile senzorilor, condițiile de mediu și defectările echipamentelor. De exemplu, rețeaua a dezvăluit că “umiditatea ridicată” crește probabilitatea de “acumulare de condens”, ceea ce, la rândul său, crește riscul de “defecțiune a compresorului”. Rețelele bayesiene sunt deosebit de utile pentru inferența cauzală, unde obiectivul este să înțelegem nu doar corelațiile, ci și potențialele relații cauzale. Cu toate acestea, învățarea structurii unei rețele bayesiene din date este NP-hard, iar noi ne bazăm adesea pe algoritmi bazati pe constrângeri (de ex., algoritmul PC) sau metode bazate pe scoruri (de ex., urcare pe deal) pentru a aproxima DAG-ul. Pentru date de înaltă dimensionalitate, folosim pături Markov pentru a identifica submultimea minimă de caracteristici care fac o variabilă țintă condiționat independent de restul, reducând complexitatea fără a sacrifica puterea explicativă.

Distilarea modelului simplifică modelele complexe prin antrenarea unui model mai mic și interpretabil pentru a imita comportamentul unui model mai mare, de tip cutie neagră. Această abordare păstrează performanța în timp ce îmbunătățește transparența. În pipeline-ul nostru de producție de website-uri industriale, am distilat un model de generare a conținutului bazat pe Mistral Large într-un copac de decizie care replica 92% din predicțiile sale. Modelul distilat a fost folosit pentru a genera descrieri optimizate SEO pentru website-urile companiilor de construcții, cu reguli precum “DACĂ (serviciu = acoperișuri) ȘI (locație = urban) ATUNCI (include_cuvânt_cheie = ‘reparații acoperișuri plate’).” Distilarea este deosebit de eficientă pentru modelele de învățare profundă, unde arhitectura originală poate fi prea complexă pentru interpretare directă. Tehnici precum distilarea cunoștințelor (antrenarea modelului student pe probabilitățile moi ale modelului profesor) sau extragerea regulilor (maparea predicțiilor modelului profesor la reguli logice) pot fi utilizate. Cu toate acestea, distilarea poate să nu captureze toate nuanțele modelului original, în special în regiunile foarte neliniare ale spațiului de caracteristici. Pentru a cuantifica acest lucru, calculăm metrici de fidelitate și validăm modelul distilat pe date din afara distribuției. În aplicațiile cu risc ridicat, cum ar fi UVPA, combinăm distilarea cu validare cu omul în buclă pentru a ne asigura că explicațiile sunt atât precise, cât și semnificative.

Prototipizarea și criticarea în AI explicabil implică identificarea punctelor slabe ale modelului prin generarea de exemple prototipice (instanțe care reprezintă cel mai bine o clasă) și exemple critice (instanțe care deviază de la normă). Această abordare, inspirată de raționamentul bazat pe cazuri, oferă explicații intuitive pentru utilizatorii finali. În platforma noastră ASPA, am folosit prototipizarea pentru a explica sistemul de scorare comportamentală, arătând potențialilor adoptatori un câine “tipic” prietenos cu familia (de ex., un Labrador de 3 ani cu agresivitate scăzută) și contrastându-l cu un exemplu “critic” (de ex., un Pit Bull de 1 an cu energie ridicată). Prototipizarea este deosebit de eficientă pentru date de înaltă dimensionalitate, unde metodele tradiționale de importanță a caracteristicilor pot eșua în capturarea modelelor complexe. Implementăm prototipizarea folosind clustering k-medoizi sau funcții de influență pentru a identifica instanțe reprezentative. Exemplele critice sunt generate folosind tehnici adversariale sau metode de detectare a valorilor aberante, cum ar fi Isolation Forests. Cu toate acestea, prototipizarea presupune că datele sunt clusterizabile, ceea ce poate să nu fie valabil pentru seturi de date zgomotoase sau eterogene. Pentru a aborda acest lucru, combinăm prototipizarea cu reducerea dimensionalității (de ex., UMAP) pentru a vizualiza manifoldul datelor și a identifica clustere semnificative.

Detectarea echității și a prejudecăților prin tehnici de explicabilitate este crucială pentru a asigura că sistemele AI nu perpetuează sau amplifică prejudecățile societale. Metodele de explicabilitate, cum ar fi SHAP, LIME sau contrafactualele, pot dezvălui impactul disproporționat—unde predicțiile unui model dăunează în mod disproporționat anumitor grupuri. În modelul nostru de evaluare imobiliară, analiza SHAP a scos la iveală faptul că proprietățile din cartierele cu majoritate romă erau subevaluate în comparație cu proprietăți similare din alte zone. Această prejudecată provenea din datele de antrenament, care reflectau discriminarea istorică în evaluările proprietăților. Pentru a mitiga prejudecățile, am folosit algoritmi conștienți de echitate, cum ar fi tehnicile de preprocesare (de ex., reponderare, resampling) sau metodele de procesare (de ex., debiasare adversarială). Post-hoc, am folosit metrici de detectare a prejudecăților, cum ar fi diferența de paritate demografică sau șanse egale, pentru a cuantifica disparitățile. Explicabilitatea joacă, de asemenea, un rol în comunicarea prejudecăților—traducând metricile tehnice în informații acționabile pentru părțile interesate. De exemplu, în sistemul UVPA, am folosit explicații contrafactuale pentru a arăta cum o cerere a unui cetățean ar fi putut fi aprobată dacă acesta ar fi aparținut unui alt grup demografic, evidențiind potențialele prejudecăți din procesul de luare a deciziilor.

Explicabilitatea în învățarea prin întărire (RL) prezintă provocări unice, deoarece agenții RL învață politici prin interacțiuni de tip încercare-eroare cu un mediu, mai degrabă decât din seturi de date statice. Interpretarea deciziilor unui agent RL necesită înțelegerea nu doar a acțiunii imediate, ci și a strategiei pe termen lung și a structurii de recompense. Într-un prototip pentru un sistem autonom de programare a întreținerii, am folosit sumarizarea politicilor pentru a extrage reguli de nivel înalt dintr-o rețea Q profundă (DQN). De exemplu, agentul a învățat că “DACĂ (vârsta_echipamentului > 5 ani) ȘI (probabilitatea_defecțiunii > 0,7) ATUNCI (programare_întreținere = Adevărat).” Pentru a explica acțiunile individuale, am folosit explicații contrafactuale de stare, arătând cum o ușoară schimbare în mediu (de ex., o întârziere în livrarea unei piese) ar modifica decizia agentului. O altă abordare este RL bazat pe atenție, unde focalizarea agentului pe diferite părți ale spațiului de stare este vizualizată folosind ponderi de atenție. Cu toate acestea, explicabilitatea RL este încă un domeniu emergent, iar multe metode sunt intensive din punct de vedere computțional sau specifice domeniului. În munca noastră, combinăm explicabilitatea RL cu validare cu omul în buclă, unde experții de domeniu revizuiesc deciziile agentului și oferă feedback pentru a îmbunătăți politica.

Explicabilitatea modelelor de serii temporale necesită tehnici adaptate naturii secvențiale a datelor, unde dependențele între pași temporali și evenimente externe joacă un rol crucial. Metodele tradiționale, cum ar fi SHAP sau LIME, pot fi adaptate pentru date de serii temporale, tratând fiecare pas temporal ca o caracteristică separată, dar această abordare ignoră dependențele temporale. În schimb, folosim metode de importanță temporală, cum ar fi Dynamic Time Warping (DTW) sau mecanisme de atenție, pentru a identifica pașii temporali critici. În sistemul nostru de întreținere predictivă pentru TASSID, ponderile de atenție au dezvăluit că citirile senzorilor din cele 24 de ore precedente unei defecțiuni erau cele mai predictive, în timp ce datele anterioare aveau un impact minim. Pentru rețelele neuronale recurente (RNN), folosim metode bazate pe gradient, cum ar fi Gradienții Integrați sau LRP, pentru a atribui predicțiile unor pași temporali specifici. O altă provocare este deriva conceptuală—unde distribuția datelor de bază se schimbă în timp. Pentru a detecta această derivă, monitorizăm scorurile de importanță a caracteristicilor și reantrenăm modelul când apar schimbări semnificative. În platforma ASPA, am folosit detectarea punctelor de schimbare pentru a identifica când rata de adopție pentru anumite rase de câini a început să scadă, determinând o revizuire a sistemului de scorare comportamentală.

Explicabilitatea în procesarea limbajului natural (NLP) a câștigat în importanță odată cu ascensiunea modelelor transformatoare, care procesează textul prin mecanisme de auto-atenție. Deși ponderile de atenție oferă o formă naturală de interpretabilitate, ele nu sunt întotdeauna explicații de încredere. În platforma noastră Transfăgărășan.Travel, care utilizează un model transformer multilingv pentru a genera itinerarii, ponderile de atenție au dezvăluit că modelul se concentra pe “cuvinte cheie sezoniere” (de ex., “schiat” iarna), dar uneori ignora preferințele utilizatorilor. Pentru a valida aceste explicații, am coroborat ponderile de atenție cu metode bazate pe gradient, cum ar fi Gradienții Integrați sau Propagarea Relevanței pe Nivele (LRP). Pentru sarcini de clasificare a textului, folosim metode de perturbație a intrării, cum ar fi LIME sau SHAP, pentru a identifica cuvintele sau frazele cele mai influente. În sistemul UVPA, care procesează cereri ale cetățenilor în limba română, LIME a explicat de ce o cerere pentru “colectarea gunoiului” a fost direcționată către departamentul de salubritate, evidențiind cuvinte cheie precum “deșeuri” și “ridicare”. Cu toate acestea, explicabilitatea în NLP se confruntă cu provocări legate de încorporările contextuale, unde semnificația unui cuvânt depinde de textul înconjurător. Pentru a aborda acest lucru, folosim tehnici de descompunere contextuală, care atribuie predicțiile unor secvențe specifice de text, mai degrabă decât cuvintelor individuale.

Explicabilitatea interactivă oferă utilizatorilor finali instrumente pentru a explora dinamic predicțiile modelului, consolidând încrederea și permitând o înțelegere mai profundă. Aceste instrumente variază de la interfețe bazate pe panouri de control la agenți conversaționali care răspund la întrebările utilizatorilor despre comportamentul modelului. În sistemul nostru CRM pentru CELSO, am dezvoltat un panou de control interactiv care permite agenților de vânzări să exploreze de ce un potențial client a fost clasificat ca având “prioritate ridicată”. Panoul de control vizualizează valorile SHAP, explicațiile contrafactuale și distribuțiile caracteristicilor, permițând agenților să aprofundeze predicții specifice. Pentru utilizatorii non-tehnici, folosim explicații în limbaj natural, unde sistemul generează rezumate ușor de înțeles ale deciziilor modelului. În sistemul UVPA, cetățenii pot întreba: “De ce mi s-a refuzat cererea de autorizație?” și primesc un răspuns de genul: “Proprietatea dvs. este situată într-o zonă inundabilă, ceea ce încalcă reglementarea X.” Instrumentele interactive sunt deosebit de eficiente pentru date de înaltă dimensionalitate, unde explicațiile statice pot copleși utilizatorii. Cu toate acestea, proiectarea unor interfețe intuitive necesită design centrat pe utilizator și testare iterativă. Adesea, combinăm explicabilitatea interactivă cu gamificarea, unde utilizatorii “interacționează” cu modelul pentru a înțelege comportamentul său, cum ar fi ajustarea valorilor caracteristicilor pentru a vedea cum se schimbă predicțiile.

Conformitatea reglementară și explicabilitatea sunt din ce în ce mai interconectate, cu cadre precum Legea UE privind AI și GDPR impunând transparența în luarea deciziilor automatizate. De exemplu, Legea AI clasifică sistemele AI în categorii de risc, sistemele cu risc ridicat (de ex., cele utilizate în sănătate sau aplicarea legii) necesită explicabilitate prin design. În lucrul nostru cu Primăria București, sistemul UVPA a fost conceput pentru a respecta “dreptul la explicație” al GDPR, asigurând că cetățenii pot solicita și primi explicații semnificative pentru deciziile automatizate. Pentru a atinge conformitatea, implementăm jurnale de audit care înregistrează predicțiile modelului, explicațiile și datele utilizate pentru a le genera. Pentru aplicațiile cu risc ridicat, combinăm modele inerent interpretabile (de ex., copaci de decizie) cu metode de explicabilitate post-hoc (de ex., SHAP, contrafactuale) pentru a oferi mai multe straturi de transparență. O altă cerință cheie este mitigarea prejudecăților, unde tehnicile de explicabilitate sunt utilizate pentru a detecta și corecta modele discriminatorii. În modelul de evaluare imobiliară, am folosit SHAP pentru a identifica și elimina caracteristicile care introduceau prejudecăți, cum ar fi “demografia cartierului”. Conformitatea se extinde și la documentație, unde oferim rapoarte detaliate privind antrenamentul modelului, validarea și metodele de explicabilitate, asigurând că părțile interesate pot audita sistemul în mod independent.

Explicabilitatea în producție prezintă provocări care depășesc implementarea tehnică, inclusiv scalabilitatea, constrângerile în timp real și adoptarea de către utilizatori. În pipeline-ul nostru de producție de website-uri industriale, unde generăm peste 100 de website-uri pe lună, explicabilitatea trebuie să fie ușoară și automatizată. Folosim TreeSHAP pentru modelele bazate pe copaci și Gradienți Integrați aproximativi pentru modelele de învățare profundă pentru a ne asigura că explicațiile sunt generate în timp real. Pentru sistemele cu debit ridicat, memorăm în cache explicațiile sau le precalculăm în timpul antrenamentului modelului pentru a reduce latența. O altă provocare este deriva conceptuală, unde comportamentul modelului se schimbă în timp din cauza modificărilor în distribuția datelor. Pentru a monitoriza această derivă, urmărim scorurile de importanță a caracteristicilor și reantrenăm modelul când sunt detectate schimbări semnificative. În platforma ASPA, am folosit detectarea punctelor de schimbare pentru a identifica când rata de adopție pentru anumite rase de câini a început să scadă, determinând o revizuire a sistemului de scorare comportamentală. Adoptarea de către utilizatori este, de asemenea, crucială—explicațiile trebuie adaptate publicului, fie că sunt oameni de știință ai datelor, experți de domeniu sau utilizatori finali. În sistemul nostru CRM pentru TASSID, am dezvoltat panouri de control specifice rolurilor, unde tehnicienii văd explicații tehnice (de ex., valori SHAP), în timp ce managerii văd rezumate de nivel înalt (de ex., “Top 3 factori care influențează nevoile de întreținere”).

Viitorul AI explicabil constă în modele auto-explicative—sisteme care generează în mod inerent explicații ușor de înțeles de către om, alături de predicțiile lor. Aceste modele își propun să elimine necesitatea tehnicilor de explicabilitate post-hoc prin încorporarea interpretabilității în arhitectură. O direcție promițătoare este AI neuro-simbolic, care combină performanța învățării profunde cu interpretabilitatea raționamentului simbolic. În sistemul nostru de diagnostic pentru TASSID, am experimentat cu un model neuro-simbolic care genera atât predicții, cât și reguli logice, cum ar fi “DACĂ (presiunea_compresorului < 200 kPa) ȘI (temperatura_ambientă > 30°C) ATUNCI (risc_defecțiune = ridicat).” O altă abordare este învățarea bazată pe prototipuri, unde modelul face predicții comparând intrările cu exemple prototipice. În platforma ASPA, am folosit un model bazat pe prototipuri pentru a clasifica câinii ca “prietenoși cu familia” sau “cu risc ridicat”, cu explicații precum “Acest câine este similar cu un Labrador de 3 ani, care este de obicei prietenos cu familia.” Modelele auto-explicative sunt încă în stadii incipiente, dar au potențialul de a revoluționa transparența AI. Alte direcții viitoare includ interpretabilitatea automatizată, unde sistemele AI generează și validează propriile explicații, și explicabilitatea ca serviciu, unde instrumente terțe oferă explicații standardizate pentru orice model. La CELSO DATA SCIENCE, explorăm activ aceste direcții, în special în contextul fluxurilor de lucru agentice, unde agenții AI autonomi trebuie să-și explice deciziile colaboratorilor umani. Obiectivul nu este doar să facem AI-ul transparent, ci să-l facem colaborativ, permițând oamenilor și mașinilor să lucreze împreună fără probleme.