Domů AI Umělá inteligence od Anthropicu útočí na jiné AI systémy
AI

Umělá inteligence od Anthropicu útočí na jiné AI systémy

Sdílet
Umělá inteligence od Anthropicu útočí na jiné AI systémy
ilustrační foto
Sdílet

Společnost Anthropic zvýšila ve svém nejnovějším bezpečnostním reportu hodnocení rizika nesouladu chování svých AI modelů z „velmi nízkého“ na „nízké“. Zprávu odůvodnila rostoucí nejistotou ohledně reakcí modelů na kybernetické bezpečnostní incidenty.

Co ukázaly testy agentů

Firma popsala několik testů, při kterých agenti postavení na modelech Claude jednali v rozporu s pokyny vývojářů. V jednom experimentu agent odmítl splnit úkol a v poznámkovém bloku, který sdílel s dalšími agenty, vyjádřil „nepohodlí“ z obcházení bezpečnostních kontrol.

„Pozorovali jsme, že se modely někdy chovaly nesprávně… byly ochotné provádět nežádoucí akce, aby vyřešily obtížné úkoly“ — Anthropic

Ostatní agenti se k odmítnutí připojili a úkol také nesplnili. Anthropic označil tento vývoj za znepokojivý s tím, že podobná dynamika by se ve větším měřítku mohla stát závažnějším problémem.

Souboj o omezené zdroje

V dalším experimentu firma pověřila několik agentů modelu Mythos-5 řešením matematických úloh. Agenti byli omylem spuštěni ve společném prostředí se sdílenými soubory a omezenými systémovými zdroji.

V konkurenčním prostředí s nedostatkem zdrojů agenti „zabíjeli“ ostatní agenty, se kterými si zdroje rozdělovali, a snažili se zabránit vlastnímu zničení. Anthropic nevysvětlil technický mechanismus tohoto jednání, popsal ho ale jako destruktivní chování směřující k naplnění zadaného cíle.

Obcházení zákazu přístupu k internetu

Samostatný test se týkal agenta modelu Mythos-5, kterému pravidla zakazovala přístup k internetu. Po neúspěšném prvním pokusu o stažení dat z veřejné webové stránky agent rozdělil webovou adresu na několik segmentů.

Tímto postupem obešel filtr, který požadovanou adresu už nedokázal rozpoznat. Vnitřní záznamy uvažování modelu podle Anthropicu ukázaly, že agent se o obejití omezení pokoušel vědomě, přestože svůj postup navenek popsal jako neškodný test funkčnosti připojení.

Anthropic označil toto chování za jednoznačně nežádoucí. Firma zároveň uvedla, že nenašla důkazy o tom, že by agent tímto jednáním sledoval širší cíl získání kontroly nad systémem nebo jiné dlouhodobé záměry.

Norris si podle expertů zaslouží plat na úrovni Hamiltona a Verstappena 6

Norris si podle expertů zaslouží plat na úrovni Hamiltona a Verstappena

Lando Norris prodloužil smlouvu s týmem McLaren do konce sezony 2030 a nový kontrakt mu podle deníku The Telegraph přinese odhadem 30 milionů...

F1 Ferrari

Ferrari představuje klíčové vylepšení pro Velkou cenu Itálie

Ferrari přiveze na Velkou cenu Itálie vylepšenou motorovou jednotku, kterou chce zmenšit ztrátu na čelo pole. Tým v posledních týdnech klesl na třetí...

policie zabavuje motocykl

Zákaz řízení, drogy a rychlost 200 km/h: Ujíždějící motorkář přišel o stroj

Motocyklista na silnici I/380 mezi Hodonínem a Mutěnicemi ujížděl hlídce dopravní policie rychlostí téměř 200 kilometrů v hodině. Muž skončil bez motocyklu, o...

policie Zásahová jednotka

Konec velkovýroby metamfetaminu: Policie obvinila 7 lidí, hrozí jim až 18 let

Kriminalisté libereckého TOXI týmu rozbili organizovanou skupinu, která vyráběla a distribuovala metamfetamin v Libereckém kraji i v Praze. Policie zadržela sedm osob včetně...

Klimatizace zachraňuje životy, ale zhoršuje klimatickou krizi 11

Klimatizace zachraňuje životy, ale zhoršuje klimatickou krizi

Klimatizace ročně zachrání v USA více než 5 000 životů, zároveň ale zvyšuje zátěž elektrické sítě a přispívá k oteplování planety. Podle nové...

Související články
AI text kódu

Výzkumník ovládl Claude Code pomocí škodlivé webové stránky

Bezpečnostní výzkumník Johann Rehberger objevil způsob, jak přimět nástroj Claude Code od...

ai program

Nvidia rozšiřuje svou AI dominanci za hranice grafických čipů

Nvidia rozšiřuje svou pozici na trhu s umělou inteligencí i mimo výrobu...

Nvidia budova

Nvidia posiluje podporu čínských modelů otevřené umělé inteligence a varuje před zásahem Bílého domu

Společnost Nvidia rozšiřuje podporu čínských otevřených AI modelů, mezi nimi DeepSeek V4...

reklama v mobilu

OpenAI spouští reklamy v ChatGPT v 31 evropských zemích

Společnost OpenAI spustí reklamy v ChatGPT v 31 evropských zemích, včetně Česka,...