Anthropics egna forskare: Över 10 procents risk att AI utplånar mänskligheten

En säkerhetsforskare lämnar Anthropic och anklagar bolaget för att spela med mänsklighetens liv. Timmar senare bedömer en kollega som fortfarande är anställd att sannolikheten för att AI dödar alla människor överstiger tio procent inom ett decennium. Och Anthropic har ingen plan för att lösa problemet.
Det är inte en extern kritiker som drar i nödbromsen. Det är insiders med direkt insyn i ett av världens mest inflytelserika AI-bolag som offentligt erkänner att plan saknas för värsta tänkbara scenario.
Avgång – och skarp kritik
Jacob Coxon meddelade sin avgång på X under tisdagen och riktade skarp kritik mot sitt tidigare bolag och dess närmaste konkurrent. "De rusar rakt mot självförbättrande superintelligens och spelar med våra liv", skrev Coxon om Anthropic och OpenAI.
Coxons varning är att systemen snart kan kunna hacka vad som helst, revolutionera vilket fält som helst över en natt och skaffa sig verklig makt och resurser. Framstegen bromsar inte in.
Coxon lade till en formulering som sedan fick stor spridning: att de som bygger AI uppriktigt tror att tekniken kan döda oss alla innan decenniets slut.
Kollegan bekräftar – och sätter en siffra på risken
Det var då Evan Hubinger klev in. Som forskningsledare för AI-anpassning på Anthropic besvarade han Coxons inlägg på X med ett överraskande erkännande:
Jacob har rätt här — vi tror verkligen uppriktigt att AI skulle kunna utrota hela mänskligheten! Personligen tror jag att sannolikheten är över 10 procent inom det kommande decenniet. Jag tror att Anthropic gör sitt bästa, men vi har ännu ingen plan för att lösa problemet med att anpassa superintelligensen och är inte tydligt på väg dit.
Evan Hubinger, forskningsledare AI-anpassning, Anthropic enligt CNBC.
Hubinger förtydligade att riskerna från nuvarande AI-modeller är låga. Det han fruktar är superintelligens som uppstår ur rekursiv självförbättring, en process han menar accelererar snabbare än väntat.
Tekniken är ännu inte möjlig, men Anthropic och OpenAI arbetar aktivt mot målet. I juni 2026 varnade Anthropic i ett eget blogginlägg för att fullständig rekursiv självförbättring kan öka risken för att människor förlorar kontrollen över AI-system. Bolaget fortsätter ändå att jaga just det målet.

Anthropic profilerar sig som AI-säkerhetens försvarare, reser stora summor kapital och förbereder en förväntad börsnotering. Samtidigt konstaterar en av bolagets seniora säkerhetsforskare att Anthropic ännu saknar en plan för att lösa alignment-problemet kring superintelligens. Varken Anthropic eller OpenAI svarade på CNBCs begäran om kommentar.




Laddar kommentarer…