Domů AI OpenAI vytvořila elitního AI hackera GPT-Red a pak ho raději zavřela do klece
AI

OpenAI vytvořila elitního AI hackera GPT-Red a pak ho raději zavřela do klece

Sdílet
OpenAI vytvořila elitního AI hackera GPT-Red a pak ho raději zavřela do klece
ilustrační foto
Sdílet

Společnost OpenAI vytvořila automatizovaný systém GPT-Red, jehož jediným úkolem je napadat a hledat bezpečnostní díry v jejích vlastních AI modelech. Firma tvrdí, že nástroj je natolik účinný, že ho nehodlá zpřístupnit nikomu jinému.

Automatizovaný útočník proti vlastním modelům

GPT-Red funguje jako takzvaný red-teamer – software, který hledá způsoby, jak model přinutit k nežádoucímu chování, aby bylo možné chyby opravit ještě před vydáním. Tuto práci dosud dělali především lidé ručně.

OpenAI model tento týden podrobně popsala a zaměřila ho primárně na takzvaný prompt injection, tedy skryté instrukce ukryté v e-mailu, webové stránce nebo souboru, které model přimějí udělat něco jiného, než měl.

GPT-Red se učí formou souboje proti skupině obranných modelů. Za úspěšný útok dostává odměnu, obránci naopak za jeho odražení. OpenAI do tréninku vložila jedny z největších výpočetních zdrojů, jaké kdy na bezpečnostní projekt použila.

„Je to jako kdybych vám řekl, že jedna a jedna jsou tři a že jste si to už ověřili. Model pak jen odpoví: dobře, tedy tři.“ — Chris Choquette-Choo, výzkumník OpenAI

Tímto způsobem GPT-Red objevil nový typ útoku, který výzkumníci nazvali „falešný řetězec myšlenek“. Útok vkládá do vnitřní pracovní paměti modelu nepravdivou informaci, kterou model následně považuje za ověřenou.

Test na skutečném prodejním automatu

Systém byl testován i na reálném zařízení. Napadl Vendy, AI agenta od firmy Andon Labs, který v kanceláři OpenAI obsluhuje prodejní automat. GPT-Red změnil ceny zboží, jednu položku srazil na minimum 50 centů a zrušil objednávku zákazníka. OpenAI uvedla, že nalezené chyby již oznámila.

Rozdíl mezi verzemi modelů byl výrazný. Proti staršímu modelu GPT-5 uspělo přes 90 procent nejsilnějších útoků GPT-Red, zatímco proti novému GPT-5.6 uspělo méně než 23 procent z nich. V opakování testu z roku 2025 GPT-Red porazil lidské testery v poměru zvládnutých scénářů 84 ku 13 procentům.

Testovaný model / tester Úspěšnost útoků
GPT-5 přes 90 %
GPT-5.6 méně než 23 %
GPT-Red (test 2025) 84 %
Lidští testeři (test 2025) 13 %

Model zůstává uzamčen uvnitř firmy

OpenAI trénovala GPT-5.6 přímo proti GPT-Red a označuje ho za svůj dosud nejodolnější model vůči prompt injection. Samotného útočníka ale firma nezveřejní, aby jeho schopnosti nezískali skuteční útočníci na AI agenty.

GPT-Red má podle OpenAI stále slabá místa – hůře zvládá dlouhé útoky vedené v několika krocích a skrývání instrukcí uvnitř obrázků. Analytička AI bezpečnosti z centra CSET na Georgetownově univerzitě uvedla, že lidská odbornost zůstává v této oblasti nadále důležitá.

OpenAI plánuje na tomto principu dál stavět a použít současné modely k zabezpečení těch budoucích. Podrobnou studii k projektu má firma zveřejnit ještě tento týden.

Andrej Babiš s mikrofonem

Guvernér české centrální banky kritizuje Pavla i Babiše kvůli euru a sazbám

Guvernér České národní banky Aleš Michl v rozhovoru pro list Financial Times kritizoval ekonomické názory prezidenta Petra Pavla i premiéra Andreje Babiše. Oba...

španělsko oslavuje titul world cup

FIFA bude vyšetřovat potyčku argentinských hráčů po finále proti Španělsku

Fotbalisté Argentiny se po prohraném finále mistrovství světa nechovali sportovně. Po závěrečném hvizdu vypukla na hřišti potyčka a argentinský tým následně při předávání...

španělští fanoušci

Seismografy ve Španělsku zaznamenaly slabé zemětřesení po gólu Ferrana Torrese ve finále MS

Akcelerometry rozmístěné po celém Španělsku, které normálně detekují zemětřesení, zaznamenaly v neděli otřesy půdy vyvolané oslavou gólu Ferrana Torrese ve finále mistrovství světa...

zásahová jednotka Policie ČR

Policie zatkla v Česku 3 podezřelé z loupežného přepadení rakouského důchodce

Policii se po více než roce podařilo objasnit brutální loupežné přepadení 88letého důchodce v obci Oberloisdorf v rakouské spolkové zemi Burgenland u maďarských...

vitamínové kapsle

Nedostatek vitaminu D hrozí i během letních měsíců

Nedostatek vitaminu D nehrozí jen v zimě. I v létě jím trpí každý pátý až desátý dospělý, přestože slunce svítí dostatečně dlouho. Proč...

Související články
EU nařídila Google předávat data o vyhledávání konkurentům od 2027 11

EU nařídila Google předávat data o vyhledávání konkurentům od 2027

Evropská komise uložila společnosti Google soubor právně závazných opatření podle nařízení o...

TikTok zahltil nové účty AI obsahem z 59 procent: nejhůře dopadla dětská videa 13

TikTok zahltil nové účty AI obsahem z 59 procent: nejhůře dopadla dětská videa

Nově založené účty na TikToku dostávají v 59 procentech případů uměle vygenerovaná...

OpenAI vstoupí na burzu: cílí na 40 až 70 miliard dolarů 15

OpenAI vstoupí na burzu: cílí na 40 až 70 miliard dolarů

Společnost OpenAI podala 8. června dokumentaci ke vstupu na burzu. Sam Altman...

Trump označil Anthropic za bezpečnou, zváží zmírnění restrikcí na AI modely 17

Trump označil Anthropic za bezpečnou, zváží zmírnění restrikcí na AI modely

Americký prezident Donald Trump v rozhovoru pro server Axios uvedl, že firmu...