Společnost OpenAI vytvořila automatizovaný systém GPT-Red, jehož jediným úkolem je napadat a hledat bezpečnostní díry v jejích vlastních AI modelech. Firma tvrdí, že nástroj je natolik účinný, že ho nehodlá zpřístupnit nikomu jinému.
Automatizovaný útočník proti vlastním modelům
GPT-Red funguje jako takzvaný red-teamer – software, který hledá způsoby, jak model přinutit k nežádoucímu chování, aby bylo možné chyby opravit ještě před vydáním. Tuto práci dosud dělali především lidé ručně.
OpenAI model tento týden podrobně popsala a zaměřila ho primárně na takzvaný prompt injection, tedy skryté instrukce ukryté v e-mailu, webové stránce nebo souboru, které model přimějí udělat něco jiného, než měl.
GPT-Red se učí formou souboje proti skupině obranných modelů. Za úspěšný útok dostává odměnu, obránci naopak za jeho odražení. OpenAI do tréninku vložila jedny z největších výpočetních zdrojů, jaké kdy na bezpečnostní projekt použila.
„Je to jako kdybych vám řekl, že jedna a jedna jsou tři a že jste si to už ověřili. Model pak jen odpoví: dobře, tedy tři.“ — Chris Choquette-Choo, výzkumník OpenAI
Tímto způsobem GPT-Red objevil nový typ útoku, který výzkumníci nazvali „falešný řetězec myšlenek“. Útok vkládá do vnitřní pracovní paměti modelu nepravdivou informaci, kterou model následně považuje za ověřenou.
Test na skutečném prodejním automatu
Systém byl testován i na reálném zařízení. Napadl Vendy, AI agenta od firmy Andon Labs, který v kanceláři OpenAI obsluhuje prodejní automat. GPT-Red změnil ceny zboží, jednu položku srazil na minimum 50 centů a zrušil objednávku zákazníka. OpenAI uvedla, že nalezené chyby již oznámila.
Rozdíl mezi verzemi modelů byl výrazný. Proti staršímu modelu GPT-5 uspělo přes 90 procent nejsilnějších útoků GPT-Red, zatímco proti novému GPT-5.6 uspělo méně než 23 procent z nich. V opakování testu z roku 2025 GPT-Red porazil lidské testery v poměru zvládnutých scénářů 84 ku 13 procentům.
| Testovaný model / tester | Úspěšnost útoků |
|---|---|
| GPT-5 | přes 90 % |
| GPT-5.6 | méně než 23 % |
| GPT-Red (test 2025) | 84 % |
| Lidští testeři (test 2025) | 13 % |
Model zůstává uzamčen uvnitř firmy
OpenAI trénovala GPT-5.6 přímo proti GPT-Red a označuje ho za svůj dosud nejodolnější model vůči prompt injection. Samotného útočníka ale firma nezveřejní, aby jeho schopnosti nezískali skuteční útočníci na AI agenty.
GPT-Red má podle OpenAI stále slabá místa – hůře zvládá dlouhé útoky vedené v několika krocích a skrývání instrukcí uvnitř obrázků. Analytička AI bezpečnosti z centra CSET na Georgetownově univerzitě uvedla, že lidská odbornost zůstává v této oblasti nadále důležitá.
OpenAI plánuje na tomto principu dál stavět a použít současné modely k zabezpečení těch budoucích. Podrobnou studii k projektu má firma zveřejnit ještě tento týden.