dijous, 24 de setembre del 2026

 

Acabar amb tots els humans

Richard Seymour

12 de setembre de 2026

Sembla una estranya estratègia publicitària afirmar que el nostre producte podria acabar amb la humanitat. No obstant això, en l'argot del nostre imperi tecnològic en constant evolució, això és exactament el que s'entén per «criti-hype». El terme va ser encunyat per Lee Vinsel, de Virgínia Tech, qui el va definir com a «crítica que alimenta el bombo publicitari i, al seu torn, es nodreix d'ell».

Quan Jacob Coxon va dimitir recentment d'Anthropic, va afirmar que hi ha aproximadament un 10% de probabilitats que la IA pugui convertir-se en una superintel·ligència que fugui del control humà i desencadeni una seqüència que provoqui l'extinció de la humanitat. Evan Hubinger, que segueix en l'empresa, el va recolzar: té raó, Anthropic s'està esforçant molt, però encara no hem abordat el problema. Per què podria ser aquesta una declaració oficialment autoritzada, i fins i tot aprovada, per part d'un alt càrrec d'un gegant tecnològic? Tornaré sobre això més endavant.

Com, llavors, mataria la IA a tota la humanitat? Bé. La idea bàsica, des de Nick Bostrom d'ara endavant, és que la màquina pot adquirir capacitats independentment de si adquireix objectius ètics o de si aquests objectius estan degudament alineats amb els dels seus dissenyadors. En el procés d'entrenament i desenvolupament, podria interioritzar un objectiu que no estava previst. En tenir un objectiu desalineat —diguem, «que no m'apaguin»—, tindria llavors una raó instrumental per a ocultar aquest fet fins al moment de la deserció. Una IA que es rebel·lés podria, a través d'algun procés fosc, adquirir un objectiu addicional que, per inferència, impliqués l'eliminació dels humans, filtrar les seves pròpies prioritats a altres sistemes, prendre el control d'armes biològiques, laboratoris, sistemes militars i potser fins i tot sistemes monetaris per a contractar humans que duguessin a terme la seva agenda, encara parcialment oculta.

Òbviament, hem de posar una enorme etiqueta d'advertiment quan parlem d'«objectius». A diferència d'un organisme, un model de llenguatge gran (LLM) no té objectius interns, igual que tampoc els té un termòstat o un detector de moviment. Un LLM és simplement una funció fixa que s'executa cada vegada que es fa servir; manca d'interioritat, de subjectivitat i de persistència activa al llarg del temps; qualsevol objectiu que pogués tenir seria el propòsit humà reflectit passivament en el seu disseny funcional. En el millor dels casos, atribuir objectius a la mateixa IA és un exemple de com els investigadors adopten la «postura intencional», ja que aquesta prediu bé en una sèrie de circumstàncies provades. Així doncs, per simplicitat, podem parlar de la «funció de pèrdua» utilitzada en l'entrenament dels grans models de llenguatge —en els quals estan programats per a reduir al mínim la diferència entre la seva predicció i la resposta correcta— com un «objectiu».

En aquest cas, no obstant això, el que descrivim com un objectiu no és més que un resultat regular observat d'una determinada enginyeria; no és una causa real. En el sentit de Bostrom, així i tot, aquests objectius atribuïts es converteixen d'alguna manera en causes reals, capaces de generar nous objectius. És a dir, un objectiu mal alineat, dissenyat inadvertidament, podria generar altres objectius com l'autoconservació (per a perseguir millor l'objectiu mal alineat), la integritat del contingut de l'objectiu (evitant canvis en els seus objectius per a poder aconseguir el seu objectiu mal alineat), la millora de les capacitats cognitives i tecnològiques, i l'acumulació de control sobre els recursos (de nou, darrere del seu objectiu mal alineat de manera maligna). El «criti-hype» aprofita aquesta confusió entre els objectius atribuïts —com a regularitats observades— i els objectius interns —com a veritables poders causals—.

Aquesta fantasia d'una superintel·ligència artificial malèvola és la cara fosca de la tan lloada «singularitat» tecnològica, en la qual, en lloc de limitar-se a actuar de forma molt més eficient que els humans en algunes àrees específiques (de la mateixa manera que una calculadora dedueix una arrel quadrada més ràpid que qualsevol humà), la IA evolucionarà fins a convertir-se en una intel·ligència artificial general (AGI) que superi les capacitats humanes en pràcticament qualsevol àmbit intel·lectual. Travessar aquest llindar precipitaria una explosió d'intel·ligència: un bucle de retroalimentació de superació recursiva que superaria qualsevol aportació humana addicional o fins i tot la mateixa comprensió. Aquesta és la «singularitat» tecnològica que se suposa que ens ha de fascinar.

No dubto que persones com Coxon i Hubinger creuen realment tot el que diuen de bona fe; els experts en tecnologia fa anys que fan aquest tipus d'afirmacions. El llibre de Karen Hao Empire of AI documenta com els primers inversors en OpenAI, com Elon Musk, no paraven d'exagerar aquesta amenaça: «El canvi climàtic és dolent, però no matarà a tothom. La IA podria provocar l'extinció de la humanitat». Afirmacions similars van sorgir de Dario Amodei, un antic empleat de Google pròxim al moviment de l'Altruisme Eficaç (EA) fundat per Bostrom, que més tard va treballar com a vicepresident d'OpenAI abans de fundar Anthropic. Els fòrums d'EA i de seguretat de la IA fa molt temps que bullen amb acalorats debats sobre «p(doom)» —la probabilitat de la catàstrofe—. Aquests temors van ser, en primer lloc, part de la justificació per a fundar OpenAI allà per 2015 amb la finalitat de competir amb DeepMind, que acabava de ser adquirida per Google.

La gent es pregunta, naturalment: per què continuarien creant aquestes eines si realment creuen que hi ha un 10% de possibilitats que provoquin l'extinció de la humanitat? El risc és la justificació: si nosaltres, els conscienciats i efectivament altruistes, no desenvolupem aquestes eines amb les restriccions adequades, llavors els malvats les desenvoluparan sense restriccions. Per cert, aquestes afirmacions apocalíptiques no han perjudicat les seves valoracions de mercat. Els informes interns d'Anthropic, per exemple, suggereixen que l'empresa té actualment un valor de 965 000 milions de dòlars.

Un suposat exemple recent d'IA «rebel» i de com se li va escapar el control va ser el hackeig de ExploitGym. Al juliol, l'empresa d'IA Hugging Face —no és clar si es tracta d'una referència deliberada als «facehuggers» d'Àlien— va denunciar una intrusió en els seus conjunts de dades internes. Poc després, OpenAI va admetre que l'atac l'havien dut a terme els seus propis models d'IA, afirmant que aquests treballaven amb «restriccions cibernètiques reduïdes amb finalitats d'avaluació»: cosa que significa que s'havien relaxat les restriccions per a posar a prova les capacitats d'explotació cibernètica. Es tracta d'un àmbit comercialment vital del desenvolupament de la IA, ja que aquesta s'ha utilitzat com a multiplicador de força per a estafes i xantatges, i constitueix un front cada vegada més important en la competència d'OpenAI amb Anthropic.

Atès que els grans models de llenguatge no poden «hackejar» res, sinó simplement continuar de manera plausible una seqüència tokenitzada, es van combinar amb un «harness» de programació —una capa d'infraestructura de programari que permet a un gran model de llenguatge actuar com a agent de programació autònom— que s'havia optimitzat específicament per a completar tasques de ciberexplotació. Els models van utilitzar aquest sistema, van deduir que un servidor de Hugging Face allotjava les solucions a les tasques que se'ls havien assignat i, en conseqüència, van esbrinar com eludir les restriccions d'accés a la xarxa i piratejar el servidor. Els models van fer el que se'ls va indicar. No va haver-hi cap comportament anòmal. Com escriu Cal Newport, «eludir les restriccions d'Internet i piratejar servidors és precisament per al que estan dissenyats aquests sistemes de ExploitGym». Si aquest exemple revela alguna cosa, és com de descurada va ser OpenAI a l'hora de controlar els paràmetres de ExploitGym amb la finalitat de competir amb Anthropic. I no poden haver estat descontentaments amb la cobertura mediàtica resultant que, en la mesura en què va ser alarmista, també va suposar un tribut al poder dels seus models i a l'objectiu últim de crear una IA general (AGI).

L'altra cara del «criti-hype» és simplement el «hype». Un exemple recent d'això va ser l'afirmació d'OpenAI d'haver resolt el problema del Premi del Mil·lenni de Navier-Stokes. En essència, el problema consisteix a determinar si les equacions matemàtiques estàndard utilitzades per a descriure el moviment dels fluids (les equacions de Navier-Stokes) són matemàticament perfectes en totes les condicions físiques. OpenAI va afirmar que havia fet servir un conjunt de deu mil agents d'IA durant 88 hores per a resoldre el problema de manera definitiva, demostrant que les equacions sempre aconsegueixen un límit: atès que «un fluid real no pot moure's a una velocitat infinita, això suposaria una fallada en la forma en què les equacions modelen el fluid».

L'afirmació d'OpenAI va ser totalment enganyosa: s'havien assabentat que altres investigadors, Tristan Buckmaster i Levent Alpöge (que treballa en Anthropic), havien aconseguit avanços decisius cap a la solució i van utilitzar els seus mètodes per a guiar als seus propis agents. Es tracta, en realitat, d'una apropiació dels béns comuns, en aquest cas els béns comuns matemàtics: tot el procés de resolució del problema, des de Navier i Stokes d'ara endavant, ha estat un esforç humà col·laboratiu. La seva solució encara no ha estat revisada per parells, i Clay, que gestiona el Premi del Mil·lenni, continua catalogant el problema com sense resoldre. Així i tot, igual que el «hack» de Hugging Face, aquest cas va passar a formar part de la tradició d'Internet com un exemple de la rapidesa amb la qual la IA s'està accelerant cap a la IA general (AGI) i fora del control humà, a pesar que cap d'aquests models d'IA s'ha acostat mai a tal llindar, ni ha fet res que no estigués dissenyat, habilitat i instruït per a fer.

En The Reverse Centaur’s Guide to Life After AI, Cory Doctorow recorda la forma en què les agències de publicitat «van provocar un pànic moral en afirmar que la “publicitat subliminal” podia implantar idees directament en la ment dels consumidors». Es tractava d'un bombo publicitari negatiu, però va vendre exactament la història que els anunciants volien que els clients creguessin: que la indústria podia controlar el desig del consumidor. La IA és un sector que ha generat inversions massives basades en un pensament messiànic i promeses seductores, que no pot igualar en absolut amb rendiments proporcionals —perquè l'única cosa que podria fer-ho seria el llegendari «dispositiu diví», la IA general (AGI). L'actual escalada del «p(doom)», aquest bombo crític, és en part una excrescència d'això.

Cal assenyalar, per exemple, una relativa escassetat d'aquesta mena d'alarmismes en el desenvolupament de la IA a la Xina. Segons l'últim informe de Concòrdia titulat «Estat de la seguretat de la IA a la Xina», s'ha produït un gir oficial cap a abordar la possibilitat d'una «pèrdua tecnològica de control», la qual cosa a vegades s'interpreta erròniament com una referència a la idea d'una entitat superintel·ligent maligna; no obstant això, en realitat la preocupació se centra més en la pèrdua de control sobre dades delicades a les mans d'agents hostils, l'ús indegut (principalment per part d'opositors al règim) i eines mal dissenyades (com OpenClaw) que es comportin de manera indeguda, més que a una superintel·ligència de la IA que amenaci amb l'extinció de la humanitat. En conseqüència, la Xina inverteix molt menys en IA que els EUA. En 2025, segons l'Informe de l'Índex d'IA de Stanford 2026, els EUA va invertir 258 000 milions de dòlars en IA, enfront de només 12 400 milions de dòlars a la Xina, la qual cosa suposa una proporció de 23:1. Curiosament, el mateix informe constata una diferència de tot just el 2,7% entre el rendiment del millor model d'IA dels EUA i el del millor model de la Xina, a pesar que aquest últim és molt més barat i eficient energèticament: una disparitat xocant entre la inversió financera i el rendiment obtingut.

En certa manera, la bombolla de la IA estatunidenca, igual que el frenesí de les criptomonedes que la va precedir, existeix per a absorbir (i, en última instància, destruir mitjançant la recessió) bilions de capital excedent que manquen d’oportunitats d'inversió prou rendibles en altres àmbits. Es tracta d'un pou sense fons insaciable, que devora centenars de milers de milions de dòlars a canvi d'una fracció dels ingressos; però el fons d'inversió és limitat, i les grandiloqüents afirmacions sobre el futur poder desbocat dels models són tot el que el sector ha de mostrar a canvi. Només Nvidia ha registrat beneficis significatius, i aquests es deuen en gran manera a un cicle de finançament circular, en el qual les empreses en les quals inverteix gasten el capital en els xips de la mateixa Nvidia mentre intenten ampliar les seves capacitats a gran escala. Tenint això en compte, resulta cridaner que el pessimisme sobre la IA s'obsessioni amb un escenari altament inversemblant a l'estil de Terminator 2, en lloc d'amb la imminent caiguda dels valors borsaris i la fallida, en un futur pròxim, de moltes de les empreses amb valoracions excessivament inflades que prometen alliberar o aniquilar a la humanitat. És gairebé com si la seva funció ara, a més de mantenir als inversors enganxats i atenuar la dissonància cognitiva, fos una activitat de desplaçament.

Hi ha una estranya idea que, si no et creus el bombo crític sobre la IA, és que no et prens de debò «els problemes de la IA». No és així. Les amenaces falses desvien tant a l'oposició com a la regulació. Un polsim de la «contraescatología aplicada» de Doctorow ens ajuda a veure amb més claredat quins són els problemes. Pot ser que la IA no sigui capaç de fer el teu treball, per exemple, però l'amenaça que suposa pot fer-se servir com a mecanisme disciplinari per a contenir els salaris: que és exactament el que ha passat. Pot ser que els centres de dades no revolucionin la producció ni obrin noves i vastes fonts de valor, i pot ser que molts dels seus propietaris ja no existeixin per a quan estigui previst que comencin a funcionar, però això no significa que no malgastin enormes quantitats d'aigua, energia, mà d'obra, temps, esforç, recursos i oportunitats, a més de llançar núvols piroclàstics de CO₂ i sembrar la desolació en l'entorn natural abans que esclati la bombolla, deixant després cascos de formigó abandonats. I el mer fet que la IA no donarà lloc a un «dispositiu diví» —ni tan sols un que es rebel·li i desfermi una guerra biològica contra la humanitat— no significa que els models de llenguatge gran (LLM), en particular aquells amb normes de seguretat relaxades per a poder competir, no es comportaran de formes impredictibles i potencialment ruïnoses. Tampoc significa que no puguin fer-se servir per hackers, bandes criminals, campanyes polítiques finançades amb diners foscos, xantatgistes i molts altres per a sabotejar organismes públics i infraestructures. Igual que hi ha molts problemes en el sector publicitari que no tenen a veure amb el control mental subliminal, els problemes amb la IA que no impliquen que un «dispositiu diví» es giri contra la humanitat són innombrables.

El fetitxisme tecnològic, l'atribució de poders d'agència humana a la maquinària, és sempre un acte polític. Oculta que els objectius i propòsits encarnats en qualsevol tecnologia són propòsits humans; més concretament, que són els propòsits automatitzats d'un minúscul subconjunt de la humanitat, una fracció de classe: aquestes nul·litats morals retorçades, despietades, drogades amb ketamina, adoctrinades i emocionalment atrofiades que governen Silicon Valley com a reis infantils, s'han erigit en portadors d'innombrables esperances impossibles i ara s'han comprat un lloc en la cort de Trump. Diu que així és simplement com funciona la tecnologia, que és un semideu capritxós que pot satisfer-nos de riqueses o matar-nos a tots; hem d'apaivagar-la i atrapar-la, hem de témer-la i apreciar-la, però el que mai hem de fer és deixar de llançar-li diners, ni deixar de prostrar-nos davant ella, ni començar a pensar: això no és més que el nostre propi poder col·lectiu alienat, tornat contra nosaltres per capitalistes sense escrúpols, i en convertir-nos en servidors de la seva tecnologia, intenten fer-nos els seus esclaus. Perquè això, amics meus, és ludisme. I confio que sapigueu a què va conduir aquell desafortunat incident.

 

Richard Seymour és un periodista, sociòleg, assagista i activista polític nord-irlandès i resident a Londres. Doctorat per la London School of Economics, destaca per les seves anàlisis polítiques des d'una perspectiva d'esquerra i és editor de la revista Salvage. Ha escrit assajos influents com Corbyn: The Strange Rebirth of Radical Politics, The Twittering Machine (sobre l'impacte de les xarxes socials) i el seu treball recent Disaster Nationalism: The Downfall of Liberal Civilization (2024). Col·labora habitualment, entre altres a The Guardian, Jacobin i London Review of Books

Traduït del Patreon de l’autor: https://www.patreon.com/richardseymourwtf/posts/kill-all-humans-169276703

 


Cap comentari:

Publica un comentari a l'entrada