Il valutatore nell’era dell’intelligenza artificiale

KEY POINTS

  • Il segretariato del Committee on Toxicity britannico ha messo per iscritto, in una matrice Swot discussa l’8 settembre, cosa si aspettano e cosa temono i suoi membri dall’intelligenza artificiale.
  • Per il consulente la macchina è la ridondanza dell’uomo, per il regolatore l’uomo è la ridondanza della macchina. La logica del formaggio svizzero non cambia e il documento ammette che anche i dati animali, il gold standard, hanno i loro buchi.
  • Il muro della competenza vale anche per chi valuta: l’eccesso di fiducia erode le competenze, ai regolatori manca la formazione e l’intelligenza artificiale «sostiene e non sostituisce il giudizio dell’esperto». Chi presenta un dossier deve aspettarsi domande su chi ha addestrato il modello, con quali dati e con quale supervisione.

In un documento del governo britannico pubblicato il 4 settembre, fra le minacce dell’intelligenza artificiale per la valutazione del rischio chimico, c’è una riga che dice «Skynet», con autocoscienza e superintelligenza tra parentesi. Non è un forum e non è un blog, ma un documento del segretariato del Committee on Toxicity (Cot). Il comitato consiglia la Food Standards Agency e il governo britannico sulla tossicità delle sostanze negli alimenti, nei prodotti di consumo e nell’ambiente.

Il documento di 22 pagine raccoglie in un’analisi Swot (cioè forze, debolezze, opportunità e minacce) le voci dei membri sull’uso di questi strumenti di intelligenza artificiale nel loro lavoro.

Nel primo articolo che avevo scritto sull’intelligenza artificiale avevo esaminato l’AI dal punto di vista del consulente evidenziando due aspetti importanti: (i) l’introduzione di una ridondanza sui propri controlli a costo marginale e (ii) la possibilità di avere un interlocutore competente disponibile a ogni ora. Tutto questo a patto che lo strumento sia guidato da chi ha già la competenza specifica.

Il documento del Cot permette di sedersi dall’altra parte del tavolo rispetto al consulente, dove siede chi i dossier li valuta. La sorpresa è che le due idee tornano uguali, ma capovolte.

Il documento è nato in meno di un anno. Il 21 ottobre 2025 il segretariato ha portato al comitato un testo di inquadramento, scritto per preparare il workshop sull’intelligenza artificiale tenuto in quello stesso mese. Quel testo è poi diventato un rapporto sullo stato della scienza, discusso a porte chiuse il 31 marzo 2026. I membri hanno chiesto di fissare la posizione del comitato con uno degli strumenti più vecchi della pianificazione strategica, la matrice Swot, che il documento fa risalire al System of Plans di Stewart del 1963, quando si chiamava ancora Soft.

Partiamo dalla ridondanza. Per il consulente la macchina è il secondo ingegnere di Houston, quello che rifà i calcoli in parallelo; nel documento del Cot i ruoli si invertono, perché è la macchina a calcolare e l’uomo a verificare. «Richiede supervisione umana e interpretazione», scrive il segretariato fra le debolezze, con una parentesi «incide sulla velocità» che ne registra il costo. Tra le minacce, la mancanza di esperti che sorveglino i punteggi di rischio è la premessa di «fallimenti catastrofici» in caso di allucinazione o di guasto. È il formaggio svizzero di James Reason letto al contrario. Nel mio primo articolo la fetta nuova era l’algoritmo, messo dietro l’occhio umano; qui la fetta da tenere al suo posto è l’occhio umano, messo dietro l’algoritmo. La logica non cambia: i buchi delle due fette non devono allinearsi.

C’è però un passaggio in cui il documento va oltre il primo articolo. Fra le minacce elenca la tenuta della fiducia del pubblico in una previsione fatta da una macchina e si chiede come spiegare che quella previsione ha un’incertezza e che qualche volta sarà sbagliata. Poi aggiunge, tra parentesi, «lo stesso vale per i dati animali, ma diamo per scontato che siano sempre corretti e li trattiamo come gold standard». Vuol dire che anche la fetta di riferimento ha i suoi buchi. Nei riquadri di sintesi in fondo al documento la parentesi non c’è più, ma resta agli atti.

In bibliografia c’è l’articolo di Thomas Hartung su Frontiers in Artificial Intelligence del 2023, dove il read-across automatico Rasar raggiunge l’87 per cento di accuratezza bilanciata su nove test Ocse e 190mila sostanze. È un risultato superiore alla riproducibilità dei test sugli animali. La ridondanza serve a questo, a far sì che due metodi con errori diversi non sbaglino nello stesso punto.

Poi c’è il muro della competenza, il “wall effect” di un esperimento di Harvard e Stanford citato nel mio primo articolo – lo strumento migliora tutti, ma chi non conosce il mestiere non raggiunge chi lo conosce – che il documento del Cot ritrova senza esperimenti. Tra le minacce mette l’uso da parte di non esperti, che porta a interpretare male i risultati o ad applicarli dove non vanno, insieme all’eccesso di fiducia, che col tempo erode competenze e capacità di decidere. Fra le debolezze compare la mancanza di professionisti che tengano insieme chimica, tossicologia e scienza dei dati, mentre per i regolatori stessi il documento ammette che la scarsa formazione «potrebbe essere una limitazione grave all’accettazione». Il ragionamento si chiude con una frase sola: l’intelligenza artificiale «sostiene e non sostituisce il giudizio dell’esperto».

Non è una posizione isolata. Il resoconto del workshop Ecetoc dell’ottobre 2024, uscito nel 2026 su Archives of Toxicology e citato in bibliografia, elenca fra i requisiti di un’intelligenza artificiale responsabile la governance, la spiegabilità, le applicazioni adatte allo scopo e la supervisione umana. I dati Fair sono il «prerequisito» di qualsiasi sistema affidabile.

C’è una paura che il consulente non ha e che il regolatore mette per iscritto. Nel primo articolo il marine senza l’Avatar restava un buon marine; qui la preoccupazione è l’Avatar senza il marine, cioè un’istituzione che non abbia più dentro di sé nessuno in grado di dire se la previsione è sensata. Da questa paura discendono le voci più politiche dell’elenco: la preferenza per modelli sviluppati dal settore pubblico, perché i regolatori ne controllino sviluppo e uso; il rischio di modelli in mano ad aziende estere che ne dettino l’evoluzione; la richiesta di formare il personale a usarli e a validarli. Il regolatore, in sostanza, vuole essere lui il marine. Per chi prepara i dossier è un’indicazione sulla direzione che prenderà l’accettazione dei metodi nei prossimi anni.

Sull’interlocutore competente il documento è più prudente del consulente, ma la traiettoria è la stessa. Le opportunità sono ordinate per orizzonte: nel breve periodo ricerca bibliografica, recupero e sintesi dei dati, nel medio scrittura di codice e sviluppo dei prompt, nel lungo integrazione dei modelli nella valutazione del rischio. Chi lavora con questi strumenti ha già cominciato a salire questa scala, con la differenza che il consulente la sale da solo e il comitato con un intero sistema. In quel sistema non è chiaro come un modello si concili con le buone pratiche di laboratorio (Glp), la legislazione non tiene il passo e far accettare una previsione read-across al posto di un test sugli animali resta difficile, per ammissione del documento.

Lungo la scala stanno le opportunità che interessano di più chi scrive i dossier, come le miscele e l’esposizione aggregata, dove i dati di tossicità e di dose-risposta «sono spesso scarsi» e si va avanti con giudizio esperto e assunzioni. Segue l’apprendimento federato, con cui chi costruisce i modelli condivide i parametri e non i dati, allargando il dominio chimico coperto.

Il resto delle minacce è la lista delle condizioni in cui i dossier verranno letti. C’è la letteratura scientifica di bassa qualità o generata dalle macchine, che, se finisce nei set di addestramento, peggiora i risultati. Ci sono gli attacchi avversari, in cui un modello viene manipolato per classificare male la tossicità di una molecola, con tanto di rimando a un documento del National Cyber Security Centre del 2026. Resta l’incertezza su chi risponde di una decisione influenzata da una previsione, insieme alla richiesta di trasparenza tecnica e “oltre la tecnica” che le agenzie porranno prima di accettare una valutazione basata su un modello. Chi oggi mette un modello dentro un dossier deve aspettarsi domande diverse da quella sull’accuratezza: chi lo ha addestrato, con quali dati, dentro quale dominio di applicabilità e con quale supervisione.

Le conclusioni del documento stanno in quattro riquadri colorati, con le voci sopravvissute alla scrematura, cioè dodici forze, undici debolezze, tredici opportunità e dodici minacce. Skynet è sparito; la riga ora dice «attacchi informatici, intelligenza artificiale agentica, autocoscienza e superintelligenza». La supervisione umana è rimasta in due quadranti, fra le debolezze – dove la parentesi sul costo è diventata «incide su velocità ed efficienza» – e fra le minacce, perché mancano esperti che controllino i punteggi, mentre la formazione del personale a usare e validare i modelli resta fra le opportunità. Il giudizio dei membri sulla sintesi si leggerà nei verbali dell’8 settembre, non ancora usciti. Il prossimo appuntamento è il 20 ottobre, con il workshop annuale il giorno dopo. Nel mio primo articolo scrivevo che questi strumenti non cambiano la natura del lavoro del consulente, ne cambiano la qualità. A leggere i riquadri del Cot, vale anche per chi sta dall’altra parte del tavolo, a una condizione che il documento ripete più volte. A Houston i calcoli li rifacevano in quattro. Il documento del Cot chiede che almeno uno dei quattro resti umano.

Riferimenti

Lunghi F., Il consulente nell’era dell’intelligenza artificiale, Tossicologia Regolatoria, https://www.tossicologiaregolatoria.it/il-consulente-nellera-dellintelligenza-artificiale/

Committee on Toxicity of Chemicals in Food, Consumer Products and the Environment (COT), AI in chemical risk assessment: SWOT analysis report, documento di discussione TOX/2026/33 per la riunione dell’8 settembre 2026, GOV.UK, 4 settembre 2026, https://www.gov.uk/government/publications/8th-september-2026-committee-on-toxicity-meeting/ai-in-chemical-risk-assessment-swot-analysis-report