Domů AI OpenAI vytvořila elitního AI hackera GPT-Red a pak ho raději zavřela do klece
AI

OpenAI vytvořila elitního AI hackera GPT-Red a pak ho raději zavřela do klece

Sdílet
OpenAI vytvořila elitního AI hackera GPT-Red a pak ho raději zavřela do klece
ilustrační foto
Sdílet

Společnost OpenAI vytvořila automatizovaný systém GPT-Red, jehož jediným úkolem je napadat a hledat bezpečnostní díry v jejích vlastních AI modelech. Firma tvrdí, že nástroj je natolik účinný, že ho nehodlá zpřístupnit nikomu jinému.

Automatizovaný útočník proti vlastním modelům

GPT-Red funguje jako takzvaný red-teamer – software, který hledá způsoby, jak model přinutit k nežádoucímu chování, aby bylo možné chyby opravit ještě před vydáním. Tuto práci dosud dělali především lidé ručně.

OpenAI model tento týden podrobně popsala a zaměřila ho primárně na takzvaný prompt injection, tedy skryté instrukce ukryté v e-mailu, webové stránce nebo souboru, které model přimějí udělat něco jiného, než měl.

GPT-Red se učí formou souboje proti skupině obranných modelů. Za úspěšný útok dostává odměnu, obránci naopak za jeho odražení. OpenAI do tréninku vložila jedny z největších výpočetních zdrojů, jaké kdy na bezpečnostní projekt použila.

„Je to jako kdybych vám řekl, že jedna a jedna jsou tři a že jste si to už ověřili. Model pak jen odpoví: dobře, tedy tři.“ — Chris Choquette-Choo, výzkumník OpenAI

Tímto způsobem GPT-Red objevil nový typ útoku, který výzkumníci nazvali „falešný řetězec myšlenek“. Útok vkládá do vnitřní pracovní paměti modelu nepravdivou informaci, kterou model následně považuje za ověřenou.

Test na skutečném prodejním automatu

Systém byl testován i na reálném zařízení. Napadl Vendy, AI agenta od firmy Andon Labs, který v kanceláři OpenAI obsluhuje prodejní automat. GPT-Red změnil ceny zboží, jednu položku srazil na minimum 50 centů a zrušil objednávku zákazníka. OpenAI uvedla, že nalezené chyby již oznámila.

Rozdíl mezi verzemi modelů byl výrazný. Proti staršímu modelu GPT-5 uspělo přes 90 procent nejsilnějších útoků GPT-Red, zatímco proti novému GPT-5.6 uspělo méně než 23 procent z nich. V opakování testu z roku 2025 GPT-Red porazil lidské testery v poměru zvládnutých scénářů 84 ku 13 procentům.

Testovaný model / tester Úspěšnost útoků
GPT-5 přes 90 %
GPT-5.6 méně než 23 %
GPT-Red (test 2025) 84 %
Lidští testeři (test 2025) 13 %

Model zůstává uzamčen uvnitř firmy

OpenAI trénovala GPT-5.6 přímo proti GPT-Red a označuje ho za svůj dosud nejodolnější model vůči prompt injection. Samotného útočníka ale firma nezveřejní, aby jeho schopnosti nezískali skuteční útočníci na AI agenty.

GPT-Red má podle OpenAI stále slabá místa – hůře zvládá dlouhé útoky vedené v několika krocích a skrývání instrukcí uvnitř obrázků. Analytička AI bezpečnosti z centra CSET na Georgetownově univerzitě uvedla, že lidská odbornost zůstává v této oblasti nadále důležitá.

OpenAI plánuje na tomto principu dál stavět a použít současné modely k zabezpečení těch budoucích. Podrobnou studii k projektu má firma zveřejnit ještě tento týden.

policie zabavuje motocykl

Zákaz řízení, drogy a rychlost 200 km/h: Ujíždějící motorkář přišel o stroj

Motocyklista na silnici I/380 mezi Hodonínem a Mutěnicemi ujížděl hlídce dopravní policie rychlostí téměř 200 kilometrů v hodině. Muž skončil bez motocyklu, o...

policie Zásahová jednotka

Konec velkovýroby metamfetaminu: Policie obvinila 7 lidí, hrozí jim až 18 let

Kriminalisté libereckého TOXI týmu rozbili organizovanou skupinu, která vyráběla a distribuovala metamfetamin v Libereckém kraji i v Praze. Policie zadržela sedm osob včetně...

Norris si podle expertů zaslouží plat na úrovni Hamiltona a Verstappena 8

Norris si podle expertů zaslouží plat na úrovni Hamiltona a Verstappena

Lando Norris prodloužil smlouvu s týmem McLaren do konce sezony 2030 a nový kontrakt mu podle deníku The Telegraph přinese odhadem 30 milionů...

Klimatizace zachraňuje životy, ale zhoršuje klimatickou krizi 10

Klimatizace zachraňuje životy, ale zhoršuje klimatickou krizi

Klimatizace ročně zachrání v USA více než 5 000 životů, zároveň ale zvyšuje zátěž elektrické sítě a přispívá k oteplování planety. Podle nové...

Nepál řeka mezi skálami

Nepálský filmař pátrá po nezvěstných v zatopených tunelech pomocí dronů

Záchranáři v Nepálu hledají stovky pohřešovaných dělníků v tunelech vodních elektráren zavalených bahnem po loňských záplavách. Piloti dronů narážejí na zcela zaplněné prostory...

Související články
AI text kódu

Výzkumník ovládl Claude Code pomocí škodlivé webové stránky

Bezpečnostní výzkumník Johann Rehberger objevil způsob, jak přimět nástroj Claude Code od...

ai program

Nvidia rozšiřuje svou AI dominanci za hranice grafických čipů

Nvidia rozšiřuje svou pozici na trhu s umělou inteligencí i mimo výrobu...

Nvidia budova

Nvidia posiluje podporu čínských modelů otevřené umělé inteligence a varuje před zásahem Bílého domu

Společnost Nvidia rozšiřuje podporu čínských otevřených AI modelů, mezi nimi DeepSeek V4...

reklama v mobilu

OpenAI spouští reklamy v ChatGPT v 31 evropských zemích

Společnost OpenAI spustí reklamy v ChatGPT v 31 evropských zemích, včetně Česka,...