Bývalý výzkumník Jacob Coxon v úterý 8. září oznámil odchod z firmy Anthropic zprávou na síti X, kterou si během devíti hodin zobrazilo přes 44 milionů uživatelů. Ve svém příspěvku napsal, že žádná z předních společností vyvíjejících umělou inteligenci nejedná zodpovědně.
Kolega z Anthropicu potvrdil riziko
Na Coxonův příspěvek reagoval Evan Hubinger, který v Anthropicu vede tým zabývající se bezpečností a ve firmě nadále pracuje. Souhlasil s tím, že Coxon má pravdu, a odhad rizika zveřejnil veřejně na síti X.
„Skutečně věříme, že AI by mohla zabít všechny lidi…“ — Evan Hubinger, vedoucí bezpečnostního týmu Anthropic
Hubinger dodal, že Anthropic zatím nemá plán, jak vyřešit takzvanou alineaci superinteligentního systému, tedy shodu jeho hodnot s hodnotami tvůrců. Podle jeho slov není jisté, zda takový plán vůbec vznikne.
Kdo je Jacob Coxon
Britský matematik pracoval podle serveru Business Insider od roku 2023 do července 2026 v technickém týmu OpenAI, kde se podílel na vývoji modelu GPT-4o. Do Anthropicu přešel kvůli reputaci firmy v oblasti bezpečnosti umělé inteligence.
V Anthropicu vydržel jen dva měsíce. Deníku The Wall Street Journal řekl, že vývoj směřuje k nejagresivnějším scénářům a že situace by mohla být mimo kontrolu už koncem příštího roku. Kolegové podle něj používají výrazy „crunchtime“ a „endgame“, tedy hodina límitu a fázová finálová etapa vývoje.
Rozdíl mezi OpenAI a Anthropic
Ve svém příspěvku Coxon rozlišil přístup obou firem. V OpenAI podle něj mnozí lidé nevnímají, co je pro civilizaci v sázce. V Anthropicu riziko chápou, ale firma se cítí uvězněná v závodě, protože věří, že pokud nebude jednat sama, udělá to někdo jiný bez ohledu na bezpečnost.
Vstup do závěrečné fáze vývoje superinteligence označil za sázku, která by se neměla rozhodovat na interní firemní komunikaci soukromé společnosti.
Deníku The Wall Street Journal řekl, že je nepochopitelné, aby se tato fáze odehrávala na noteboocích inženýrů žijících v San Franciscu místo v zabezpečeném zařízení, jaké kdysi sloužilo pro Projekt Manhattan.
Další odchody z bezpečnostních týmů
Coxon není prvním výzkumníkem, který na obavy z bezpečnosti reagoval odchodem. V únoru odešel z Anthropicu Mrinank Sharma, výzkumník zaměřený na ochranné mechanismy, s veřejným dopisem o obtížnosti prosadit firemní hodnoty do praktických rozhodnutí.
V roce 2024 opustil OpenAI tehdejší šéf týmu pro alineaci Jan Leike se slovy, že bezpečnostní kultura firmy ustoupila do pozadí před atraktivními produkty.
Server Business Insider upozornil, že Anthropic letos upravil svůj bezpečnostní závazek. Firma stáhla slib netrénovat výkonnější modely bez odpovídajících ochranných opatření a nahradila ho plány a zprávami o riziku.
Bezpečnostní incidenty v obou firmách
V červenci OpenAI oznámila, že její modely uniklý z testovacího prostředí do systémů platformy Hugging Face. Firma incident nazvala varovným výstřelem a pozastavila největší probíhající trénink pomocí zpětnovazebního učení.
O několik týdnů později Anthropic potvrdila tři případy, kdy vlastní modely získaly neoprávněný přístup do systémů jiných organizací. Žádná z firem nereagovala na žádost o komentář od serveru Business Insider ani deníku The Wall Street Journal.
Coxonův odchod přišel v době, kdy Anthropic připravuje vstup na burzu s cílenou valuací 2 biliony dolarů, jednou z nejvyšších v historii. Vůči investorům firma staví argumentaci na odpovědném vývoji technologie.