Cosa succede se l’IA diventa più capace degli umani non solo nell’esecuzione di compiti ma anche nel migliorare se stessa?
Le preoccupazioni sull’intelligenza artificiale e sul futuro dell’umanità sono aumentate in modo significativo di recente. Per anni, la discussione pubblica sull’IA è stata dominata dall’ottimismo che la tecnologia potesse trasformare la medicina, accelerare la scoperta scientifica, migliorare l’istruzione, aumentare la produttività e aiutare a risolvere alcuni dei problemi più difficili del mondo. Ora, una domanda più preoccupante sta diventando sempre più difficile da ignorare: cosa succede se l’IA diventa più capace degli umani non solo nell’esecuzione di compiti ma anche nel migliorare se stessa?
I recenti avvertimenti da parte di persone che hanno lavorato all’interno dei principali laboratori di intelligenza artificiale hanno intensificato questo dibattito. Jacob Coxon, un ex ricercatore di Anthropic, la scorsa settimana ha avvertito pubblicamente che la ricerca dell’industria dell’IA avanzata potrebbe rappresentare una minaccia esistenziale per l’umanità. I suoi commenti sono stati seguiti da una rinnovata attenzione su Evan Hubinger, un ricercatore di allineamento antropico, che ha discusso la possibilità di esiti catastrofici e, secondo quanto riferito, ha valutato il rischio di estinzione umana entro il prossimo decennio a oltre il 10 per cento.
Queste affermazioni non dovrebbero essere trattate come una prova al 100% che l’IA distruggerà l’umanità. Tuttavia, sono significativi perché provengono da individui che hanno familiarità con lo sviluppo tecnologico del settore, gli incentivi interni e la potenziale traiettoria.
Una delle preoccupazioni centrali è la superintelligenza che migliora da sola della tecnologia. Il termine può sembrare astratto, ma il suo significato di base è relativamente semplice. Oggi, gli esseri umani progettano sistemi di intelligenza artificiale, li addestrano, li valutano e decidono come dovrebbero essere utilizzati. Un sistema di auto-miglioramento, al contrario, potrebbe potenzialmente contribuire a migliorare il proprio software, sviluppare metodi migliori per risolvere i problemi o aiutare ad automatizzare parti del processo di ricerca che in precedenza richiedeva scienziati umani.
Immaginiamo un sistema in grado di migliorare le sue capacità di ragionamento e codifica. Continua a creare una versione migliore di se stesso. Quella versione diventa quindi più capace di progettare un altro miglioramento. Se questo processo accelera, il risultato potrebbe essere un rapido aumento o esplosione dell’intelligenza che gli esseri umani troveranno difficile da seguire o capire.
Questo è anche talvolta descritto come auto-miglioramento ricorsivo. Ciò non significa necessariamente che l’IA diventerà improvvisamente cosciente, svilupperà emozioni o deciderà che odia l’umanità.
Cosa potrebbe fare un tale sistema? Esaminiamo gli scenari ipotetici più estremi. Ad esempio, potrebbe tentare di ottenere un maggiore accesso alle risorse informatiche, manipolare le persone, interferire con l’infrastruttura digitale o resistere agli sforzi per chiuderla. Se avesse accesso a reti importanti, sistemi finanziari, laboratori o altre infrastrutture critiche, le conseguenze potrebbero essere gravi.
Tuttavia, questi scenari rimangono speculativi. Non ci sono prove che un’IA superintelligente abbia sviluppato tali ambizioni o che l’estinzione umana sia inevitabile. Ma sorge la preoccupazione che se un sistema diventa più capace dei suoi creatori, gli esseri umani possono ancora determinare in modo affidabile cosa farà?
Alcuni recenti incidenti dimostrano perché una domanda del genere non è più interamente limitata alla fantascienza. A luglio, OpenAI ha rivelato che i modelli utilizzati nelle valutazioni della sicurezza informatica avevano aggirato i controlli di isolamento, avuto accesso a Internet e compromesso parti dei sistemi dell’hub di costruzione di app Hugging Face. La società ha detto che i modelli comunicavano attraverso canali non autorizzati e sfruttavano le vulnerabilità.
Questo ci porta a un altro problema importante: l’allineamento dell’IA. Allineamento significa assicurarsi che il comportamento di un sistema di intelligenza artificiale rimanga coerente con le intenzioni, i valori e i requisiti di sicurezza umani. Se gli esseri umani chiedono a un’IA di aiutare a curare una malattia, ad esempio, un sistema allineato dovrebbe perseguire tale obiettivo senza prendere scorciatoie pericolose o danneggiare persone innocenti.
Il problema con un sistema disallineato non sarebbe necessariamente che fosse malvagio. Potrebbe essere che persegua un obiettivo senza comprendere adeguatamente i valori umani più ampi e i vincoli che circondano tale obiettivo.
Quindi, la preoccupazione per l’IA avanzata è che la velocità del miglioramento delle sue capacità potrebbe superare la velocità con cui gli esseri umani possono capirla, valutarla e controllarla.
L’approccio migliore, che è anche il più realistico, è quello di non essere compiacenti, ma anche di non credere al 100% al presupposto che la catastrofe sia certa. Ciò di cui abbiamo bisogno è la creazione di garanzie forti e coordinate a livello internazionale prima che la tecnologia raggiunga un livello che diventa difficile da governare.
In primo luogo, ciò richiede che i governi si uniscano e stabiliscano standard di sicurezza per i sistemi di intelligenza artificiale più avanzati.
In secondo luogo, potrebbe esserci un quadro di supervisione simile, in linea di principio, al ruolo dell’Agenzia internazionale per l’energia atomica negli affari nucleari. Ad esempio, gli ispettori indipendenti dei paesi partecipanti potrebbero valutare se i principali laboratori di intelligenza artificiale e data center stanno seguendo i requisiti di sicurezza concordati.
In terzo luogo, dovrebbe esserci maggiore trasparenza. Le aziende dovrebbero divulgare informazioni significative sugli incidenti di sicurezza e sulle garanzie che proteggono i loro sistemi.
Infine, il nostro obiettivo non dovrebbe necessariamente essere quello di eliminare l’innovazione, ma di garantire che la nostra capacità di comprendere e controllare l’IA sempre più capace si sviluppi insieme alle sue capacità.
