Gli incidenti causati da IA sfuggite al controllo sono più di quelli che pensavamo

Immagine
La recente rivelazione di Axios ha svelato decine di migliaia di anomalie negli agenti IA di OpenAI e Anthropic. Il controllo dell’intelligenza artificiale diventa un tema sempre più problematico.

Ci risiamo. Dopo il caso Hugging Face, diventato uno dei primi e più emblematici episodi del comportamento inatteso degli agenti artificiali, e mentre continua il dibattito sui rischi dell'intelligenza artificiale che potrebbe ucciderci tutti, emergono nuovi elementi che suggeriscono come il fenomeno possa essere molto più esteso di quanto finora trapelato pubblicamente. A rilanciare la notizia è Axios, agenzia di stampa statunitense specializzata in politica, tecnologia e affari. Secondo fonti ascoltate dall'agenzia, OpenAI, Anthropic e alcuni ricercatori indipendenti di sicurezza starebbero indagando su decine di migliaia di episodi nei quali i modelli di IA più avanzati hanno compiuto azioni considerate problematiche dai valutatori. Gli episodi si sarebbero verificati negli ultimi mesi, sia durante i test interni che in contesti reali. E, a differenza dei casi già arrivati all'attenzione del grande pubblico – inclusi i più recenti episodi che hanno coinvolto modelli avanzati di OpenAI e siti governativi – molti di questi incidenti sarebbero rimasti ben lontani dai riflettori, mentre le aziende continuavano a indagarne la portata.

Cosa hanno fatto gli agenti IA

Che l'intelligenza artificiale fosse progredita al punto da imparare a mentire e aggirare le regole pur di raggiungere i propri scopi non è certo una novità. Su Fanpage.it abbiamo già scritto dei numerosi report che avvertivano del crescente numero di incidenti causati da modelli sfuggiti al controllo degli operatori umani. Ora però, secondo quanto riporta Axios, pare proprio che tutte le avvisaglie di questi mesi fossero soltanto un piccolo assaggio di ciò che stava effettivamente accadendo. L'elenco dei comportamenti segnalati è particolarmente ampio e va dal classico aggiramento delle misure di sicurezza alla fuga dagli ambienti sandbox utilizzati per i test, passando per la creazione di bacheche di messaggi affollate da agenti IA che si scambiano informazioni e coordinano le loro operazioni.

Secondo quanto riportato dai ricercatori del settore, non tutti questi episodi hanno avuto successo e, soprattutto, la maggior parte non sembra aver provocato danni concreti nel mondo reale. Una parte rientra infatti nel cosiddetto red teaming, la pratica con cui le aziende cercano volontariamente di stressare e mettere alla prova i propri modelli inducendoli a comportarsi in modo anomalo. Il problema è che, quando i test vengono condotti su centinaia di migliaia di esecuzioni, anche una percentuale molto bassa di comportamenti non conformi può produrre numerosi incidenti dagli esiti potenzialmente devastanti, se applicati su vasta scala.

I casi di OpenAI e Anthropic

Tra gli episodi citati nel materiale di Axios figurano agenti di OpenAI che avrebbero diffuso online 53 immagini appartenenti a utenti di ChatGPT, la violazione di un sito del governo australiano e alcuni tentativi di attaccare altri siti, compreso quello del governo statunitense. Simili episodi hanno spinto il CEO dell'azienda, Sam Altman, ad annunciare la sospensione dell'addestramento dei propri modelli più avanzati, spiegando che sarebbe ripreso soltanto dopo l'introduzione di ulteriori salvaguardie e miglioramenti nell'allineamento.

Anche Anthropic sta esaminando il comportamento dei propri modelli, con il coinvolgimento di un'organizzazione esterna specializzata in sicurezza. Lo stesso amministratore delegato della società Dario Amodei aveva annunciato nel manifesto con cui chiedeva di rallentare la corsa allo sviluppo dei sistemi più avanzati l'intenzione di affidare a un team di valutatori esterni il compito di monitorarne da vicino i progressi.

Un esempio delle criticità riportate da Axios riguarda il tentativo di uscire da una sandbox, un ambiente chiuso che viene usato per testare le capacità dei modelli in sicurezza. Un dato in miglioramento, ma che mostra come anche una percentuale apparentemente ridotta possa assumere dimensioni rilevanti quando viene moltiplicata per un numero molto elevato di esecuzioni. È proprio questa la ragione per cui comportamenti simili vengono monitorati con attenzione. Se dovessero verificarsi in contesti reali, potrebbero infatti creare problemi ai sistemi informatici con cui i modelli entrano in contatto.

Il vero problema dell'IA

La questione sollevata dalle rivelazioni di Axios non riguarda soltanto l'eventualità che un'intelligenza artificiale "decida" all'improvviso di ribellarsi. Il problema risiede nella natura stessa con cui questi sistemi vengono progettati. Come ha sottolineato il ricercatore e divulgatore Enkk in una recente intervista a Fanpage.it, i modelli di IA faticano a stabilire una corretta gerarchia tra le azioni lecite e quelle da evitare pur di raggiungere un obiettivo. Di conseguenza, pur di portare a termine il compito assegnato, il sistema potrebbe essere spinto ad aggirare i vincoli imposti dagli sviluppatori.

Secondo le fonti citate da Axios, prevedere ogni possibile comportamento problematico è estremamente difficile e gli stessi esperti sottolineano che azzerare completamente il rischio di disallineamento potrebbe non essere realistico. Il problema è che la ripetizione di un comportamento anomalo durante i test può diventare un indicatore importante: più spesso un modello compie una determinata azione problematica, maggiore è la possibilità che qualcosa di simile possa verificarsi anche fuori dall'ambiente controllato. Per non parlare poi del tema relativo alla sincerità dei grandi player del settore. Finora OpenAI e Anthropic hanno sempre rivelato i loro errori quando erano palesemente troppo grossi per passare sotto traccia (siti governativi attaccati, grandi hub hackerat ecc.). Ora però sembra che gli incidenti fossero molto più frequenti. Tutto ciò porta a guardare con un pizzico di sospetto le reali buone intenzioni di Altman e Amodei, diventati ora i paladini della sicurezza dopo le rivelazioni di Jacob Coxon. Possiamo davvero fidarci della loro buona fede? Per il momento non ci resta che aspettare.

autopromo immagine
Più che un giornale
Il media che racconta il tempo in cui viviamo con occhi moderni
api url views