Acabar
amb tots els humans
Richard
Seymour
12 de
setembre de 2026
Sembla una
estranya estratègia publicitària afirmar que el nostre producte podria acabar
amb la humanitat. No obstant això, en l'argot del nostre imperi tecnològic en
constant evolució, això és exactament el que s'entén per «criti-hype». El terme
va ser encunyat per Lee Vinsel, de Virgínia Tech, qui el va definir com a
«crítica que alimenta el bombo publicitari i, al seu torn, es nodreix d'ell».
Quan Jacob Coxon va dimitir recentment d'Anthropic,
va afirmar que hi ha aproximadament un 10% de probabilitats que la IA pugui
convertir-se en una superintel·ligència que fugui del control humà i
desencadeni una seqüència que provoqui l'extinció de la humanitat. Evan Hubinger, que segueix en l'empresa, el va recolzar: té raó, Anthropic
s'està esforçant molt, però encara no hem abordat el problema. Per què podria
ser aquesta una declaració oficialment autoritzada, i fins i tot aprovada, per
part d'un alt càrrec d'un gegant tecnològic? Tornaré sobre això més endavant.
Com,
llavors, mataria la IA a tota la humanitat? Bé. La idea bàsica, des de Nick
Bostrom d'ara endavant, és que la màquina pot adquirir capacitats
independentment de si adquireix objectius ètics o de si aquests objectius estan
degudament alineats amb els dels seus dissenyadors. En el procés d'entrenament
i desenvolupament, podria interioritzar un objectiu que no estava previst. En
tenir un objectiu desalineat —diguem, «que no m'apaguin»—, tindria llavors una
raó instrumental per a ocultar aquest fet fins al moment de la deserció. Una IA
que es rebel·lés podria, a través d'algun procés fosc, adquirir un objectiu
addicional que, per inferència, impliqués l'eliminació dels humans, filtrar les
seves pròpies prioritats a altres sistemes, prendre el control d'armes
biològiques, laboratoris, sistemes militars i potser fins i tot sistemes
monetaris per a contractar humans que duguessin a terme la seva agenda, encara
parcialment oculta.
Òbviament,
hem de posar una enorme etiqueta d'advertiment quan parlem d'«objectius». A
diferència d'un organisme, un model de llenguatge gran (LLM) no té objectius interns,
igual que tampoc els té un termòstat o un detector de moviment. Un LLM és
simplement una funció fixa que s'executa cada vegada que es fa servir; manca
d'interioritat, de subjectivitat i de persistència activa al llarg del temps;
qualsevol objectiu que pogués tenir seria el propòsit humà reflectit
passivament en el seu disseny funcional. En el millor dels casos, atribuir
objectius a la mateixa IA és un exemple de com els investigadors adopten la
«postura intencional», ja que aquesta prediu bé en una sèrie de circumstàncies
provades. Així doncs, per simplicitat, podem parlar de la «funció de pèrdua»
utilitzada en l'entrenament dels grans models de llenguatge —en els quals estan
programats per a reduir al mínim la diferència entre la seva predicció i la resposta
correcta— com un «objectiu».
En aquest
cas, no obstant això, el que descrivim com un objectiu no és més que un
resultat regular observat d'una determinada enginyeria; no és una causa real.
En el sentit de Bostrom, així i tot, aquests objectius atribuïts es
converteixen d'alguna manera en causes reals, capaces de generar nous
objectius. És a dir, un objectiu mal alineat, dissenyat inadvertidament, podria
generar altres objectius com l'autoconservació (per a perseguir millor
l'objectiu mal alineat), la integritat del contingut de l'objectiu (evitant
canvis en els seus objectius per a poder aconseguir el seu objectiu mal
alineat), la millora de les capacitats cognitives i tecnològiques, i
l'acumulació de control sobre els recursos (de nou, darrere del seu objectiu
mal alineat de manera maligna). El «criti-hype» aprofita aquesta confusió entre
els objectius atribuïts —com a regularitats observades— i els objectius interns
—com a veritables poders causals—.
Aquesta
fantasia d'una superintel·ligència artificial malèvola és la cara fosca de la
tan lloada «singularitat» tecnològica, en la qual, en lloc de limitar-se a
actuar de forma molt més eficient que els humans en algunes àrees específiques
(de la mateixa manera que una calculadora dedueix una arrel quadrada més ràpid
que qualsevol humà), la IA evolucionarà fins a convertir-se en una
intel·ligència artificial general (AGI) que superi les capacitats humanes en
pràcticament qualsevol àmbit intel·lectual. Travessar aquest llindar
precipitaria una explosió d'intel·ligència: un bucle de retroalimentació de
superació recursiva que superaria qualsevol aportació humana addicional o fins
i tot la mateixa comprensió. Aquesta és la «singularitat» tecnològica que se
suposa que ens ha de fascinar.
No dubto que
persones com Coxon i Hubinger creuen realment tot el que diuen de bona fe; els
experts en tecnologia fa anys que fan aquest tipus d'afirmacions. El llibre de
Karen Hao Empire of AI documenta com els primers inversors en OpenAI,
com Elon Musk, no paraven d'exagerar aquesta amenaça: «El canvi climàtic és
dolent, però no matarà a tothom. La IA podria provocar l'extinció de la
humanitat». Afirmacions similars van sorgir de Dario Amodei, un antic empleat
de Google pròxim al moviment de l'Altruisme Eficaç (EA) fundat per Bostrom, que
més tard va treballar com a vicepresident d'OpenAI abans de fundar Anthropic.
Els fòrums d'EA i de seguretat de la IA fa molt temps que bullen amb acalorats
debats sobre «p(doom)» —la probabilitat de la catàstrofe—. Aquests temors van
ser, en primer lloc, part de la justificació per a fundar OpenAI allà per 2015
amb la finalitat de competir amb DeepMind, que acabava de ser adquirida per
Google.
La gent es
pregunta, naturalment: per què continuarien creant aquestes eines si realment
creuen que hi ha un 10% de possibilitats que provoquin l'extinció de la
humanitat? El risc és la justificació: si nosaltres, els conscienciats i
efectivament altruistes, no desenvolupem aquestes eines amb les restriccions
adequades, llavors els malvats les desenvoluparan sense restriccions. Per cert,
aquestes afirmacions apocalíptiques no han perjudicat les seves valoracions de
mercat. Els informes interns d'Anthropic, per exemple, suggereixen que
l'empresa té actualment un valor de 965 000 milions de dòlars.
Un suposat
exemple recent d'IA «rebel» i de com se li va escapar el control va ser el
hackeig de ExploitGym. Al juliol, l'empresa d'IA Hugging Face —no és clar si es
tracta d'una referència deliberada als «facehuggers» d'Àlien— va
denunciar una intrusió en els seus conjunts de dades
internes. Poc després, OpenAI va admetre que l'atac l'havien dut a terme els
seus propis models d'IA, afirmant que aquests treballaven amb «restriccions
cibernètiques reduïdes amb finalitats d'avaluació»: cosa que significa que
s'havien relaxat les restriccions per a posar a prova les capacitats
d'explotació cibernètica. Es tracta d'un àmbit comercialment vital del
desenvolupament de la IA, ja que aquesta s'ha utilitzat com a multiplicador de
força per a estafes i xantatges, i constitueix un front cada vegada més
important en la competència d'OpenAI amb Anthropic.
Atès que els
grans models de llenguatge no poden «hackejar» res, sinó simplement continuar
de manera plausible una seqüència tokenitzada, es van combinar amb un «harness»
de programació —una capa d'infraestructura de programari que permet a un gran
model de llenguatge actuar com a agent de programació autònom— que s'havia
optimitzat específicament per a completar tasques de ciberexplotació. Els
models van utilitzar aquest sistema, van deduir que un servidor de Hugging Face
allotjava les solucions a les tasques que se'ls havien assignat i, en
conseqüència, van esbrinar com eludir les restriccions d'accés a la xarxa i
piratejar el servidor. Els models van fer el que se'ls va indicar. No va
haver-hi cap comportament anòmal. Com escriu Cal Newport, «eludir les restriccions d'Internet
i piratejar servidors és precisament per al que estan dissenyats aquests
sistemes de ExploitGym». Si aquest exemple revela alguna cosa, és com de
descurada va ser OpenAI a l'hora de controlar els paràmetres de ExploitGym amb
la finalitat de competir amb Anthropic. I no poden haver estat descontentaments
amb la cobertura mediàtica resultant que, en la mesura en què va ser alarmista,
també va suposar un tribut al poder dels seus models i a l'objectiu últim de
crear una IA general (AGI).
L'altra cara
del «criti-hype» és simplement el «hype». Un exemple recent d'això va ser l'afirmació d'OpenAI d'haver resolt el problema del Premi del Mil·lenni de
Navier-Stokes. En essència, el problema consisteix a determinar si les
equacions matemàtiques estàndard utilitzades per a descriure el moviment dels
fluids (les equacions de Navier-Stokes) són matemàticament perfectes en totes
les condicions físiques. OpenAI va afirmar que havia fet servir un conjunt de
deu mil agents d'IA durant 88 hores per a resoldre el problema de manera
definitiva, demostrant que les equacions sempre aconsegueixen un límit: atès
que «un fluid real no pot moure's a una velocitat infinita, això suposaria una
fallada en la forma en què les equacions modelen el fluid».
L'afirmació
d'OpenAI va ser totalment enganyosa: s'havien assabentat que altres
investigadors, Tristan Buckmaster i Levent Alpöge (que treballa en Anthropic),
havien aconseguit avanços decisius cap a la solució i van utilitzar els seus
mètodes per a guiar als seus propis agents. Es tracta, en realitat, d'una
apropiació dels béns comuns, en aquest cas els béns comuns matemàtics: tot el
procés de resolució del problema, des de Navier i Stokes d'ara endavant, ha
estat un esforç humà col·laboratiu. La seva solució encara no ha estat
revisada per parells, i Clay, que gestiona el Premi del Mil·lenni, continua
catalogant el problema com sense resoldre. Així i tot, igual que el «hack» de
Hugging Face, aquest cas va passar a formar part de la tradició d'Internet com
un exemple de la rapidesa amb la qual la IA s'està accelerant cap a la IA
general (AGI) i fora del control humà, a pesar que cap d'aquests models d'IA
s'ha acostat mai a tal llindar, ni ha fet res que no estigués dissenyat,
habilitat i instruït per a fer.
En The
Reverse Centaur’s Guide to Life After AI, Cory Doctorow recorda la forma en
què les agències de publicitat «van provocar un pànic moral en afirmar que la
“publicitat subliminal” podia implantar idees directament en la ment dels
consumidors». Es tractava d'un bombo publicitari negatiu, però va vendre
exactament la història que els anunciants volien que els clients creguessin:
que la indústria podia controlar el desig del consumidor. La IA és un sector
que ha generat inversions massives basades en un pensament messiànic i promeses
seductores, que no pot igualar en absolut amb rendiments proporcionals —perquè
l'única cosa que podria fer-ho seria el llegendari «dispositiu diví», la IA
general (AGI). L'actual escalada del «p(doom)», aquest bombo crític, és en part
una excrescència d'això.
Cal
assenyalar, per exemple, una relativa escassetat d'aquesta mena d'alarmismes en
el desenvolupament de la IA a la Xina. Segons l'últim informe de Concòrdia
titulat «Estat de la seguretat de la IA a la
Xina», s'ha
produït un gir oficial cap a abordar la possibilitat d'una «pèrdua tecnològica
de control», la qual cosa a vegades s'interpreta erròniament com una referència
a la idea d'una entitat superintel·ligent maligna; no obstant això, en realitat
la preocupació se centra més en la pèrdua de control sobre dades delicades a
les mans d'agents hostils, l'ús indegut (principalment per part d'opositors al
règim) i eines mal dissenyades (com OpenClaw) que es comportin de manera
indeguda, més que a una superintel·ligència de la IA que amenaci amb l'extinció
de la humanitat. En conseqüència, la Xina inverteix molt menys en IA que els
EUA. En 2025, segons l'Informe de l'Índex d'IA de Stanford
2026, els EUA va
invertir 258 000 milions de dòlars en IA, enfront de només 12 400 milions de
dòlars a la Xina, la qual cosa suposa una proporció de 23:1. Curiosament, el
mateix informe constata una diferència de tot just el 2,7% entre el rendiment
del millor model d'IA dels EUA i el del millor model de la Xina, a pesar que
aquest últim és molt més barat i eficient energèticament: una disparitat xocant
entre la inversió financera i el rendiment obtingut.
En certa
manera, la bombolla de la IA estatunidenca, igual que el frenesí de les
criptomonedes que la va precedir, existeix per a absorbir (i, en última
instància, destruir mitjançant la recessió) bilions de capital excedent que
manquen d’oportunitats d'inversió prou rendibles en altres àmbits. Es tracta
d'un pou sense fons insaciable, que devora centenars de milers de milions de dòlars a canvi d'una fracció dels
ingressos; però el fons d'inversió és limitat, i les grandiloqüents afirmacions
sobre el futur poder desbocat dels models són tot el que el sector ha de
mostrar a canvi. Només Nvidia ha registrat beneficis significatius, i aquests
es deuen en gran manera a un cicle de finançament circular, en el qual les
empreses en les quals inverteix gasten el capital en els xips de la mateixa
Nvidia mentre intenten ampliar les seves capacitats a gran escala. Tenint això
en compte, resulta cridaner que el pessimisme sobre la IA s'obsessioni amb un
escenari altament inversemblant a l'estil de Terminator 2, en lloc d'amb
la imminent caiguda dels valors borsaris i la fallida, en un futur pròxim, de
moltes de les empreses amb valoracions excessivament inflades que prometen
alliberar o aniquilar a la humanitat. És gairebé com si la seva funció ara, a
més de mantenir als inversors enganxats i atenuar la dissonància cognitiva, fos
una activitat de desplaçament.
Hi ha una
estranya idea que, si no et creus el bombo crític sobre la IA, és que no et
prens de debò «els problemes de la IA». No és així. Les amenaces falses desvien
tant a l'oposició com a la regulació. Un polsim de la «contraescatología aplicada» de Doctorow ens ajuda a veure amb
més claredat quins són els problemes. Pot ser que la IA no sigui capaç de fer
el teu treball, per exemple, però l'amenaça que suposa pot fer-se servir com a
mecanisme disciplinari per a contenir els salaris: que és exactament el que ha passat. Pot ser que els centres de dades no
revolucionin la producció ni obrin noves i vastes fonts de valor, i pot ser que
molts dels seus propietaris ja no existeixin per a quan estigui previst que
comencin a funcionar, però això no significa que no malgastin enormes
quantitats d'aigua, energia, mà d'obra, temps, esforç, recursos i oportunitats,
a més de llançar núvols piroclàstics de CO₂ i sembrar la desolació en l'entorn
natural abans que esclati la bombolla, deixant després cascos de formigó
abandonats. I el mer fet que la IA no donarà lloc a un «dispositiu diví» —ni
tan sols un que es rebel·li i desfermi una guerra biològica contra la
humanitat— no significa que els models de llenguatge gran (LLM), en particular
aquells amb normes de seguretat relaxades per a poder competir, no es
comportaran de formes impredictibles i potencialment ruïnoses. Tampoc significa
que no puguin fer-se servir per hackers, bandes criminals, campanyes polítiques
finançades amb diners foscos, xantatgistes i molts altres per a sabotejar
organismes públics i infraestructures. Igual que hi ha molts problemes
en el sector publicitari que no tenen a veure amb el control mental subliminal,
els problemes amb la IA que no impliquen que un «dispositiu diví» es giri
contra la humanitat són innombrables.
El
fetitxisme tecnològic, l'atribució de poders d'agència humana a la maquinària,
és sempre un acte polític. Oculta que els objectius i propòsits encarnats en
qualsevol tecnologia són propòsits humans; més concretament, que són els
propòsits automatitzats d'un minúscul subconjunt de la humanitat, una fracció
de classe: aquestes nul·litats morals retorçades, despietades, drogades amb
ketamina, adoctrinades i emocionalment atrofiades que governen Silicon Valley
com a reis infantils, s'han erigit en portadors d'innombrables esperances
impossibles i ara s'han comprat un lloc en la cort de Trump. Diu que així és
simplement com funciona la tecnologia, que és un semideu capritxós que pot
satisfer-nos de riqueses o matar-nos a tots; hem d'apaivagar-la i atrapar-la,
hem de témer-la i apreciar-la, però el que mai hem de fer és deixar de
llançar-li diners, ni deixar de prostrar-nos davant ella, ni començar a pensar:
això no és més que el nostre propi poder col·lectiu alienat, tornat contra
nosaltres per capitalistes sense escrúpols, i en convertir-nos en servidors de
la seva tecnologia, intenten fer-nos els seus esclaus. Perquè això, amics meus,
és ludisme. I confio que sapigueu a què va conduir aquell desafortunat
incident.
Richard Seymour és un periodista, sociòleg,
assagista i activista polític nord-irlandès i resident a Londres. Doctorat per
la London School of Economics, destaca per les seves
anàlisis polítiques des d'una perspectiva d'esquerra i és editor de la revista Salvage.
Ha escrit assajos influents com Corbyn: The Strange Rebirth of Radical
Politics, The Twittering Machine (sobre l'impacte de les xarxes
socials) i el seu treball recent Disaster Nationalism: The Downfall of
Liberal Civilization (2024). Col·labora habitualment, entre altres a The Guardian, Jacobin i London
Review of Books
Traduït del Patreon de l’autor: https://www.patreon.com/richardseymourwtf/posts/kill-all-humans-169276703
Cap comentari:
Publica un comentari a l'entrada