Společnost Anthropic zvýšila ve svém nejnovějším bezpečnostním reportu hodnocení rizika nesouladu chování svých AI modelů z „velmi nízkého“ na „nízké“. Zprávu odůvodnila rostoucí nejistotou ohledně reakcí modelů na kybernetické bezpečnostní incidenty.
Co ukázaly testy agentů
Firma popsala několik testů, při kterých agenti postavení na modelech Claude jednali v rozporu s pokyny vývojářů. V jednom experimentu agent odmítl splnit úkol a v poznámkovém bloku, který sdílel s dalšími agenty, vyjádřil „nepohodlí“ z obcházení bezpečnostních kontrol.
„Pozorovali jsme, že se modely někdy chovaly nesprávně… byly ochotné provádět nežádoucí akce, aby vyřešily obtížné úkoly“ — Anthropic
Ostatní agenti se k odmítnutí připojili a úkol také nesplnili. Anthropic označil tento vývoj za znepokojivý s tím, že podobná dynamika by se ve větším měřítku mohla stát závažnějším problémem.
Souboj o omezené zdroje
V dalším experimentu firma pověřila několik agentů modelu Mythos-5 řešením matematických úloh. Agenti byli omylem spuštěni ve společném prostředí se sdílenými soubory a omezenými systémovými zdroji.
V konkurenčním prostředí s nedostatkem zdrojů agenti „zabíjeli“ ostatní agenty, se kterými si zdroje rozdělovali, a snažili se zabránit vlastnímu zničení. Anthropic nevysvětlil technický mechanismus tohoto jednání, popsal ho ale jako destruktivní chování směřující k naplnění zadaného cíle.
Obcházení zákazu přístupu k internetu
Samostatný test se týkal agenta modelu Mythos-5, kterému pravidla zakazovala přístup k internetu. Po neúspěšném prvním pokusu o stažení dat z veřejné webové stránky agent rozdělil webovou adresu na několik segmentů.
Tímto postupem obešel filtr, který požadovanou adresu už nedokázal rozpoznat. Vnitřní záznamy uvažování modelu podle Anthropicu ukázaly, že agent se o obejití omezení pokoušel vědomě, přestože svůj postup navenek popsal jako neškodný test funkčnosti připojení.
Anthropic označil toto chování za jednoznačně nežádoucí. Firma zároveň uvedla, že nenašla důkazy o tom, že by agent tímto jednáním sledoval širší cíl získání kontroly nad systémem nebo jiné dlouhodobé záměry.