Společnost Anthropic zveřejnila vysvětlení k plánovanému vodoznaku pro texty generované chatbotem Claude. Opatření má splnit požadavky evropského zákona o umělé inteligenci na označování AI obsahu.
Jak vodoznak funguje
Anthropic zavádí vodoznak kvůli Transparency Code v rámci EU AI Act, který ukládá firmám vytvářejícím umělou inteligenci povinnost umožnit identifikaci textů vytvořených strojem. Debata mezi uživateli Claude se rozhořela poté, co firma tento krok oznámila začátkem týdne.
„Vodoznak neovlivňuje kvalitu výstupu Claude, čtenáři se vodoznačená odpověď od nevodoznačené neliší“ — Anthropic
Princip spočívá v tom, že model při volbě mezi rovnocennými výrazy — třeba mezi slovy „zataženo“ a „šedivo“ — vytváří ve svých odpovědích vzorec. Ten je pro čtenáře neviditelný, ale rozpoznatelný pro každého, kdo má k dispozici odpovídající klíč.
Firma pro tento účel využívá metodu SynthID-Text, kterou v roce 2024 popsal tým Google DeepMind. Anthropic zároveň plánuje vydat zveřejnit API pro detekci vodoznaku, které umožní ověřit původ textu.
Odlišení od jiných detekčních nástrojů
Anthropic zdůraznil, že vodoznačení se liší od přístupů firem jako Pangram, které hledají v textu typické jazykové vzorce prozrazující AI. Kontrola vodoznaku funguje na jiném principu než rozpoznávání stylistických „tiků“ strojového textu.
Podle firmy lehké úpravy textu vodoznak pravděpodobně neodstraní úplně, zatímco kompletní přepsání každého slova jej odstranit dokáže. V takovém případě je podle Anthropicu sporné, zda lze text ještě označit za vytvořený umělou inteligencí.
Vliv na programový kód
U programovacího kódu bude podle vyjádření firmy vodoznak méně výrazný než u běžného textu. Model totiž musí vytvářet funkční kód a nemá takovou volnost při výběru mezi rovnocennými variantami jako u přirozeného jazyka.
Vodoznak se přesto může projevit v komentářích uvnitř kódu, kde existuje prostor pro libovolnou volbu formulace. Na samotný vygenerovaný kód by však měl mít podle Anthropicu zanedbatelný vliv.
Claude nebude jediným chatbotem s tímto typem označení. Anthropic uvedl, že další velcí vývojáři modelů podepsali stejný kodex chování a chystají se zavést vlastní systémy vodoznaků.