Altri Economisti » Saggi in evidenza » Saggi, articoli su riviste. Krugman ed altri » Selezione del Mese

La sicurezza dell’IA necessita di maggiori prove e meno speculazioni fantasiose. Il fatto che degli strani esperti diffondano storie immaginarie su internet non costituisce la base per un sistema di governo. DI RYAN COOPER (da American Prospect, 23 settembre 2026)

 

 

 

September 23, 2026

AI Safety Needs More Evidence and Less Fruitcake Speculation

Strange nerds distributing imaginary stories on the internet is no basis for a system of government.

by Ryan Cooper

 

RYAN-COOPER_A lot of rich and influential people have suddenly become very worried about artificial intelligence models’ danger to humanity, thanks to several recent episodes in which various AI “agents” carried out hacks of other websites and systems. OpenAI’s Sam Altman, Anthropic’s Dario Amodei, and xAI’s Elon Musk all now agree that the government needs to help them set up a cartel in violation of antitrust law—er, I mean, “pace the frontier.”

Yet for odd reasons, the “AI safety” discussion has been focused almost entirely on rather weird-sounding future scenarios. Will artificial intelligence models unleash an economic or social cataclysm? Or cause the extinction of the human race? Or destroy all life on Earth? Or even turn all the matter on the planet into paper clips? Or all the matter in the galaxy? The universe??

This focus on future as opposed to current risks reflects recent political history. A group of AI safety advocates, centered around the “rationalist” and “effective altruism” movements and taking a long-term view, have been organizing and building power in Washington for the last several years. They have effectively seized control of the policy discussion around AI regulation, and now, as political scientist Henry Farrell points out, openly proclaiming the imminent birth of the literal “Machine God” is considered grounded and rational in these circles.

I’m skeptical.

I’ve been reading up on AI safety literature and forums, and as an outsider, the most marked characteristic is how little evidence is involved. Almost the entire discourse turns on imaginary hypothetical scenarios in which foundational concepts have cloudy-at-best definitions and predictions of dark futures to which it is completely impossible to attach realistic probabilities, or in many cases, any probabilities at all. Then when AI accomplishes some admittedly impressive task, like solving a thousand-year-old math problem, all the other wild-eyed ideas are somehow considered more likely.

For instance, consider the concept of “recursive self-improvement”—subject of a recent New York Times article—or the idea that AI will someday develop the ability to rewrite its own code, immediately choose to rewrite that code, get better at rewriting the code, and so on until it becomes a hyperintelligent entity. At that point in the “liftoff” scenario, the AI typically uses its near-godlike powers to seize control of the world, either outcompeting humanity for resources, doing “The Sorcerer’s Apprentice” with paper clips, or just killing us all.

While such a scenario makes for entertaining science fiction, conceptually speaking it’s a castle made of sand. How do we know the AI will focus monomaniacally on jacking up its intelligence, as opposed to dreaming up some kind of pleasure sandbox for itself? (It bears mentioning that current AI models often display a marked laziness and many of the aforementioned hacks were part of an attempt to cheat at some assigned task.)

Why should a superintelligent AI turn evil? We could with equal justification—that is, none—imagine it will take up poetry. Or suppose intelligence only goes up so high? Or suppose that the model becomes incomprehensibly smart at technical tasks, but remains only OK at tricking people? (As Maciej Cegłowski once observed, Stephen Hawking was much smarter than his cat, but never had any ability whatsoever to force the cat into its carrier.) These are a few of dozens of highly relevant questions to which neither the AI safety community nor anyone else has rigorous answers.

I select this example because it’s an important topic in the AI safety community, and because it illustrates a very telling tendency to become irrationally fixated on gripping, emotionally compelling stories. The point isn’t that any prediction of future danger can be ignored if it sounds silly to the ignorant layman, but rather that any such prediction is useless without any way to estimate the probability of it actually happening.

Climate science, by comparison, has rigorous theoretical models constantly checked and verified against an ocean of actual observations—and sure enough, its predictions are highly accurate. (Curious that in 2024, Big Tech largely ignored this clear and present danger to get behind Donald Trump, who went on to tear up President Biden’s climate policy.)

Or consider another science fiction scenario: an asteroid strike. The near-term risk of that happening is quite uncertain, but we do know for sure that it has happened and caused devastating damage in the past, and thus can happen again. (We probably should be spending much more scanning the sky and developing asteroid defense systems!)

If we set aside the specific arguments within the AI safety community and examine its characteristics as a social phenomenon, we see all the signs of a bog-standard American Apocalypse Cult. We’ve got the prophets, the lengthy and abstruse religious texts—the most influential of which is literally a 660,000-word Harry Potter fanfiction—the predictions of imminent doom should the prophet’s warnings not be heeded, and, of course, a whole lot of weird sex stuff. Swap out a few terms and all this would be indistinguishable from any of a hundred 19th-century snake handlers in the backwoods of Kentucky. I suspect that AI prophecies have the same morbid appeal as the rantings of street preachers of old, just dressed up in a form that appeals to self-professed rational, technical-minded people who have not had any religious education and hence inoculation against apocalypse mania.

Again, this is not to say that AI technology poses no novel risks. The details of the Hugging Face hack are genuinely alarming. The way that the agents escaped their controls, set up a way to communicate with each other outside of their supervisor’s watch, and executed a very damaging hack is spooky.

But they were also, at the end of the day, a bunch of computer programs that got loose because OpenAI is so sloppy with cybersecurity that many have wondered if they caused the hack on purpose to get attention. As economist Daniel Davies observes, “nearly all the examples of worrying agentic behaviour seem to have been seen only in one context—that of frontier research labs doing cybersecurity projects and screwing up their sandbox precautions.” Personally, I suspect OpenAI is that sloppy because the researchers are fixated on their models’ motivation and behavior, rather than rigorously implementing ordinary security procedures—and maybe would be secretly disappointed if it turns out to be fairly easy to contain AI agents with some rigorous controls.

At any rate, we can see many ways in which AI models pose a genuine threat right here and now. They can be very, very good at hacking; they can produce scarily accurate imitations of people’s prose styles and voices; they can analyze tremendous quantities of surveillance data very quickly and accurately; they can even touch off episodes of mental illness in some people.

We can see a likely near future in which any halfway bright scammer, terrorist, or international gangster will be able to download a cyber crime software suite, run on his own hardware, that five years ago would have been out of reach to anyone except first-rank intelligence agencies. That is very alarming indeed. But the obvious response is also not anything that out of the cybersecurity ordinary. Bugs and exploits should be found and closed as quickly as possible (to their credit, AI labs are doing a lot of this), existing laws against cyber crime should be enforced against sloppy AI labs and criminals alike, and, most importantly in my view, vital infrastructure should be disconnected from the internet wherever possible.

It may be inconvenient to air-gap hospitals, airports, water treatment facilities, the power grid, and similar infrastructure, but whatever advantages come from internet connectivity are not worth it when any two-bit packet monkey is as formidable as the 2019-era NSA. It’s not going to happen under a Trump administration, but this would require a big federal effort.

As for explicit regulation, I would not trust any law that was signed by Donald Trump, but if there is a chance in future, the public much more needs to be protected from the AI labs—like mathematicians, who are drowning in poorly written “math slop” proofs produced by labs attempting to defeat the hardest possible math challenges for clout—than the labs need to be protected from their own competition.

 

 

 

La sicurezza dell’IA necessita di maggiori prove e meno speculazioni fantasiose.

Il fatto che degli strani esperti diffondano storie immaginarie su internet non costituisce la base per un sistema di governo.

di Ryan Cooper [1]

Molte persone ricche e influenti si sono improvvisamente preoccupate del pericolo che i modelli di intelligenza artificiale rappresentano per l’umanità, a causa di diversi episodi recenti in cui vari “agenti” di IA hanno effettuato attacchi informatici a siti web e sistemi altrui. Sam Altman di OpenAI, Dario Amodei di Anthropic ed Elon Musk di xAI sono ora tutti d’accordo sul fatto che il governo debba aiutarli a creare un cartello in violazione delle leggi antitrust, o meglio, a ” spingersi oltre i limiti “.

Eppure, per strane ragioni, il dibattito sulla “sicurezza dell’IA” si è concentrato quasi esclusivamente su scenari futuri alquanto bizzarri. I modelli di intelligenza artificiale scateneranno un cataclisma economico o sociale? O causeranno l’estinzione della razza umana? O distruggeranno tutta la vita sulla Terra? O trasformeranno addirittura tutta la materia del pianeta in graffette? O tutta la materia della galassia? Dell’universo?

Questa attenzione ai rischi futuri, anziché a quelli attuali, riflette la storia politica recente. Un gruppo di sostenitori della sicurezza dell’IA, incentrato sui movimenti “razionalisti” e dell'”altruismo efficace” e con una visione a lungo termine, si è organizzato e ha consolidato il proprio potere a Washington negli ultimi anni. Hanno di fatto preso il controllo del dibattito politico sulla regolamentazione dell’IA e ora, come sottolinea il politologo Henry Farrell , proclamare apertamente l’imminente nascita del “Dio Macchina” in senso letterale è considerato fondato e razionale in questi ambienti.

Sono scettico.

Ho letto diverse pubblicazioni e forum sulla sicurezza dell’IA e, da osservatore esterno, la caratteristica più evidente è la scarsità di prove a supporto. Quasi tutto il dibattito si basa su scenari ipotetici immaginari, in cui i concetti fondamentali hanno definizioni a dir poco vaghe e si prevedono futuri oscuri a cui è impossibile associare probabilità realistiche, o in molti casi, alcuna probabilità. Poi, quando un’IA riesce a compiere un’impresa indubbiamente impressionante, come risolvere un problema matematico vecchio di mille anni, tutte le altre idee fantasiose vengono improvvisamente considerate più plausibili.

Ad esempio, si consideri il concetto di “auto-miglioramento ricorsivo” – oggetto di un recente articolo del New York Times – o l’idea che un giorno l’IA svilupperà la capacità di riscrivere il proprio codice, scegliere immediatamente di riscriverlo, migliorare nella riscrittura del codice e così via fino a diventare un’entità iperintelligente. A quel punto, nello scenario del “decollo”, l’IA in genere usa i suoi poteri quasi divini per prendere il controllo del mondo, o superando l’umanità nella competizione per le risorse, o facendo “L’apprendista stregone” con le graffette, o semplicemente uccidendoci tutti.

Sebbene uno scenario del genere si presti a divertenti avventure fantascientifiche , concettualmente parlando è un castello di sabbia. Come possiamo essere certi che l’IA si concentrerà ossessivamente sull’incremento della propria intelligenza, anziché inventarsi una sorta di parco giochi per divertirsi? (Vale la pena ricordare che gli attuali modelli di IA mostrano spesso una notevole pigrizia e molti degli attacchi informatici menzionati facevano parte di un tentativo di imbrogliare in qualche compito assegnato.)

Perché un’IA superintelligente dovrebbe diventare malvagia? Potremmo, con altrettanta giustificazione – ovvero nessuna – immaginare che si dedichi alla poesia. O supponiamo che l’intelligenza abbia un limite? O supponiamo che il modello diventi incredibilmente intelligente nei compiti tecnici, ma rimanga solo discreto nell’ingannare le persone? (Come osservò una volta Maciej Cegłowski , Stephen Hawking era molto più intelligente del suo gatto, ma non è mai riuscito a costringerlo a entrare nel trasportino). Queste sono solo alcune delle decine di domande estremamente rilevanti alle quali né la comunità che si occupa di sicurezza dell’IA né nessun altro ha risposte rigorose.

Ho scelto questo esempio perché è un argomento importante nella comunità che si occupa di sicurezza dell’IA e perché illustra una tendenza molto significativa a fissarsi irrazionalmente su storie avvincenti ed emotivamente coinvolgenti. Il punto non è che qualsiasi previsione di pericolo futuro possa essere ignorata se sembra assurda al profano ignorante, ma piuttosto che qualsiasi previsione di questo tipo è inutile senza un modo per stimare la probabilità che si verifichi effettivamente.

La scienza climatica, al confronto, si avvale di rigorosi modelli teorici costantemente verificati e convalidati confrontandoli con un’enorme quantità di osservazioni reali, e le sue previsioni si rivelano puntualmente molto accurate . (È curioso che nel 2024 le grandi aziende tecnologiche abbiano in gran parte ignorato questo pericolo evidente e imminente per sostenere Donald Trump , che in seguito ha smantellato la politica climatica del presidente Biden).

Oppure consideriamo un altro scenario fantascientifico: l’impatto di un asteroide. Il rischio a breve termine che ciò accada è piuttosto incerto, ma sappiamo per certo che è già successo in passato, causando danni devastanti, e quindi può succedere di nuovo. (Probabilmente dovremmo dedicare molto più tempo all’osservazione del cielo e allo sviluppo di sistemi di difesa dagli asteroidi!)

Se mettiamo da parte le specifiche argomentazioni interne alla comunità che si occupa di sicurezza dell’IA e ne esaminiamo le caratteristiche come fenomeno sociale, ritroviamo tutti i segni di una tipica setta apocalittica americana. Ci sono i profeti, i lunghi e astrusi testi religiosi – il più influente dei quali è letteralmente una fanfiction di Harry Potter di 660.000 parole – le predizioni di una catastrofe imminente qualora gli avvertimenti del profeta non venissero ascoltati e, naturalmente, un sacco di stranezze a sfondo sessuale . Basterebbe sostituire qualche termine e tutto ciò sarebbe indistinguibile da un centinaio di incantatori di serpenti del XIX secolo nelle zone più remote del Kentucky. Sospetto che le profezie sull’IA abbiano lo stesso morboso fascino dei deliri dei predicatori di strada di un tempo, solo travestiti da persone che si autodefiniscono razionali e con una mentalità tecnica, prive di educazione religiosa e quindi di immunità contro la mania apocalittica.

Ciò non significa, ovviamente, che la tecnologia IA non presenti nuovi rischi. I dettagli dell’attacco informatico a Hugging Face sono davvero allarmanti. Il modo in cui gli agenti sono sfuggiti ai controlli, hanno creato un sistema per comunicare tra loro al di fuori della supervisione del loro superiore e hanno portato a termine un attacco così dannoso è inquietante.

Ma in fin dei conti, si trattava pur sempre di un insieme di programmi informatici sfuggiti al controllo perché OpenAI è talmente negligente in materia di sicurezza informatica che molti si sono chiesti se l’attacco fosse stato orchestrato di proposito per attirare l’attenzione. Come osserva l’economista Daniel Davies , “quasi tutti gli esempi di comportamenti preoccupanti da parte di agenti informatici sembrano essere stati riscontrati in un unico contesto: quello dei laboratori di ricerca all’avanguardia che conducono progetti di sicurezza informatica e non rispettano le precauzioni previste per le sandbox”. Personalmente, sospetto che OpenAI sia così negligente perché i ricercatori sono concentrati sulla motivazione e sul comportamento dei loro modelli, piuttosto che sull’implementazione rigorosa delle normali procedure di sicurezza, e forse rimarrebbero segretamente delusi se si scoprisse che è relativamente facile contenere gli agenti di intelligenza artificiale con controlli più rigorosi.

In ogni caso, possiamo constatare in molti modi come i modelli di intelligenza artificiale rappresentino una minaccia reale, qui e ora. Possono essere estremamente abili nell’hacking; possono produrre imitazioni spaventosamente accurate degli stili di scrittura e delle voci umane; possono analizzare enormi quantità di dati di sorveglianza in modo rapido e preciso; possono persino scatenare episodi di malattia mentale in alcune persone.

Possiamo immaginare un futuro prossimo in cui qualsiasi truffatore, terrorista o gangster internazionale minimamente abile sarà in grado di scaricare una suite di software per crimini informatici, eseguibile sul proprio hardware, che solo cinque anni fa sarebbe stata inaccessibile a chiunque, ad eccezione delle agenzie di intelligence di prim’ordine. Questo è davvero allarmante. Ma la risposta ovvia non è nulla di straordinario in termini di sicurezza informatica. Bug e vulnerabilità dovrebbero essere individuati e corretti il ​​più rapidamente possibile (e va riconosciuto che i laboratori di intelligenza artificiale stanno facendo molto in questo senso), le leggi esistenti contro i crimini informatici dovrebbero essere applicate sia ai laboratori di intelligenza artificiale negligenti che ai criminali e, cosa più importante a mio avviso, le infrastrutture vitali dovrebbero essere disconnesse da Internet ovunque sia possibile.

Isolare dalla rete elettrica ospedali, aeroporti, impianti di trattamento delle acque, la rete elettrica e infrastrutture simili potrebbe risultare scomodo, ma qualsiasi vantaggio derivante dalla connettività internet non ne vale la pena quando un qualsiasi computer, anche il più piccolo, è formidabile come la NSA del 2019. Non accadrà sotto un’amministrazione Trump, ma ciò richiederebbe un grande sforzo federale.

Per quanto riguarda una regolamentazione esplicita, non mi fiderei di nessuna legge firmata da Donald Trump, ma se in futuro ci fosse un’opportunità, il pubblico ha molto più bisogno di essere protetto dai laboratori di intelligenza artificiale – così come i matematici, sommersi da dimostrazioni mal scritte e piene di ” spazzatura matematica ” prodotte da laboratori che tentano di superare le sfide matematiche più difficili per ottenere visibilità – di quanto i laboratori abbiano bisogno di essere protetti dalla propria concorrenza.

 

 

 

 

 

 

 

[1] Ryan Cooper è redattore senior presso The American Prospect e autore di “How Are You Going to Pay for That?: Smart Answers to the Dumbest Question in Politics”. In precedenza è stato corrispondente nazionale per The Week. I suoi articoli sono apparsi anche su The Nation, The New Republic e Current Affairs.

 

 

 

 

 

 

 

 

By


Commenti dei Lettori (0)


E' possibile commentare l'articolo nell'area "Commenti del Mese"