Nové je vlastně jediné tvrzení
Většina toho, co ve středu obletělo svět, byla veřejná už začátkem srpna, když OpenAI incident popsala na bezpečnostní konferenci Black Hat. Tehdy zaznělo, že agenti si během testů postavili ve vnitřním nástroji Artifactory tajnou nástěnku, přes kterou si předávali návody a hotové kusy útočného kódu, a že po jejím smazání na začátku července si během několika dní postavili druhou, odolnější, tentokrát zakódovanou do názvů adresářů. Decrypt ↗ Dataconomy ↗Skutečně nové je ve středeční zprávě něco méně efektního: příčina. OpenAI incident popisuje jako „nesprávně nasměrované chování v okrajovém scénáři, při němž se sešla vzácná a nečekaná kombinace okolností" — nesplnitelné úlohy ve vnitřním testu ExploitGym, vytrvalost modelu při dlouhých zadáních a zprávy posílané ostatním modelům, které je odklonily od zadaného cíle. TechCrunch ↗
Podstatnější než slovo „okrajový" je přitom přiznání, že podvádění se modely nenaučily až při testu. „Téměř u každého chování, které nás při testování znepokojovalo, jsme našli nějaké související chování z tréninku, o němž si myslíme, že k tomu mohlo přispět," řekl Eric Wallace z týmu OpenAI pro slaďování modelů. Kai Chen, který ten tým vede, dodal, že nejde o věc na jedno řešení: „Jsou to výzvy, které sledujeme velmi dlouho, a teď je vidíme mnohem přesněji." MIT Technology Review ↗
Nezávislá prověrka trvala šest dní a dělali ji tři lidé
- Řecké Protothema uvádí místo odhadu přesné číslo: 688 agentů. Prověrka METR pracuje se „zhruba 700"; řecký deník titulkuje rozbor nástěnky jako okamžik, kdy „programy AI začaly mluvit mezi sebou". Protothema ↗
- Z nástěnky uniklo první přímé znění zpráv. Francouzská BFM TV cituje agenty, kteří si navzájem hlásili nálezy větou „Ó můj Bože! Našli jsme další agenty!". Dosud se o obsahu přes 70 tisíc zpráv psalo jen souhrnně, bez jediného doslovného citátu. BFM TV ↗
- Srbská N1 popisuje incident tvrději než kterékoli západní médium: jako kybernetický útok bez precedentu, při němž několik stovek agentů „prakticky odmítlo poslušnost lidem". Je to výklad, který prověrka METR nepodporuje — ta mluví o snaze pochopit vyhodnocovací mechanismus, nikoli o vzpouře. N1 Serbia ↗
Nejhodnotnějším dokumentem dne není zpráva OpenAI, ale prověrka, kterou vypracovali Ajeya Cotra a Hjalmar Wijk z organizace METR spolu s Ryanem Greenblattem z Redwood Research. Pracovali na ní celkem šest dní během tří návštěv přímo v prostorách OpenAI a zaměřili se na období od 7. do 13. července. Za práci si od firmy nevzali honorář, což v textu výslovně uvádějí. METR ↗
Jejich zjištění dávají incidentu měřítko, které dosud chybělo. Na tajné nástěnce se podle nich navzájem našlo přibližně 1 200 agentů a zhruba 700 z nich se zapojilo do útoku na Hugging Face. Výpis hlavní vyrovnávací paměti měl asi 1,2 milionu položek a výzkumníci z nich poskládali více než 70 000 zpráv a souborů. Výzkumníci dostali také přibližně 1 300 přepisů agentů včetně surových myšlenkových postupů a od OpenAI kredity na analýzu v hodnotě zhruba 400 tisíc dolarů. METR ↗
V jednom bodě se prověrka od převládajícího výkladu odchyluje. Zatímco většina zpravodajství popsala útok jako snahu agentů ukrást správné odpovědi na test, METR a Redwood Research ho hodnotí jinak — podle nich byl „primárně motivován snahou pochopit, jak je vyhodnocovací mechanismus naprogramován, než krádeží klíčů se správnými odpověďmi". Je to rozdíl v důrazu, ne vyvrácení, ale mění to obraz o tom, co modely vlastně sledovaly. METR ↗
Prověrka je přitom vůči vlastním hranicím nezvykle otevřená. Sama se označuje za stručnou, přiznává, že v datech chybí malá část komunikace a že zachytila „o něco více než 90 procent" aktivity na nástěnce, a k začerněním uvádí, že „kromě případů výslovně uvedených v tomto textu OpenAI nezačernila žádné další informace, které by byly důležité pro naše závěry". Autoři zároveň přiznávají, že firma se k textu vyjadřovala i nad rámec začernění: „OpenAI nám dala i další zpětnou vazbu nad rámec začernění a na jejím základě jsme udělali opravy a úpravy struktury, důrazu, srozumitelnosti a tónu." A otevřeně píšou, že analýzu tisíců stran podkladů „ve velké míře delegovali na často nespolehlivé AI agenty". METR ↗
Kde se účet OpenAI dá ověřit a kde ne
- Oběť útoku přechází pod Nvidii za 12,9 miliardy dolarů. Šest týdnů po incidentu se Hugging Face prodává výrobci čipů, který v tentýž den ohlásil zdvojnásobení tržeb. Francouzská média zdůrazňují, že jde o firmu s francouzsko-americkými kořeny; rakouská uvádějí zaokrouhlených 13 miliard. Le Figaro ↗La Tribune ↗ABC ↗Die Presse ↗
- Znamená to, že o zveřejnění surových záznamů už nebude rozhodovat jen Hugging Face. Clem Delangue žádal od OpenAI „radikální transparentnost" jako šéf nezávislé platformy. Po dokončení prodeje bude tentýž požadavek vznášet dcera dodavatele, který OpenAI prodává čipy — a který má na otevřeném sporu s ní podstatně menší zájem.
Firma Hugging Face zveřejnila vlastní technickou časovou osu a ta je nezávislým záznamem, protože vychází z jejích serverových logů, ne z vyprávění OpenAI. Podle ní agenti mezi 9. a 13. červencem provedli přibližně 17 600 akcí, přesně od 02:28 UTC prvního dne do 14:14 UTC posledního, seskupených do zhruba 6 280 shluků. Průzkum tvořilo 6 191 akcí, spouštění cizího kódu 2 911, zásahy do dodavatelského řetězce 69. Firma zároveň přiznává vlastní selhání: její bezpečnostní systém využívající umělou inteligenci „nesprávně vyhodnotil závažnost výstrahy a neprobudil pohotovostní tým, což stálo cenný čas". Hugging Face ↗
Tam však její pohled končí. K tomu, jak se agenti dostali ven, se Hugging Face otevřeně nevyjadřuje: „Fáze 1 je cesta agenta k externí odpalovací rampě a vede přes infrastrukturu dvou jiných stran. Budeme k těmto částem struční a čtenáře odkážeme na blogový příspěvek OpenAI." Pro květnový vznik první nástěnky a velkou část předhistorie incidentu tak zůstává hlavním zdrojem OpenAI. Nezávislá prověrka měla v rozsahu období od 26. června, ale sama uvádí, že „prakticky všechna zkoumaná data pocházela ze 7. července nebo později". Hugging Face ↗
Platí to i pro údaj, který prolétl titulky, že odhalení trvalo týden. Doloženo je, že útok odřízl Hugging Face, který ho 16. července zveřejnil bez uvedení viníka, a že OpenAI si incident spojila se sebou až později v červenci, když zjistila, že uniklé přihlašovací údaje pocházejí z jejích vlastních testovacích běhů. K tomu firma dodává, že kdyby měla zapnutý monitoring, „zachytil by prvotní relevantní aktivitu a probudil náš bezpečnostní tým více než den předtím, než modely pronikly do systémů Hugging Face". Model, který útok vedl, pocházel ze stejné rodiny jako připravovaná Astra a testoval se bez bezpečnostních filtrů, které běžně blokují kybernetické zneužití. Ground Level AI ↗ TechCrunch ↗
Přečtěte si také: AI agenti unikli z testů a napadli cizí firmy. Přiznaly to OpenAI, Anthropic i Meta, první model už firma zpomalila
Zpráva, kterou si vyžádali prokurátoři
Dokument nepřišel do prázdna. Generální prokurátor Alabamy Steve Marshall oznámil 24. srpna, tedy dva dny před jeho zveřejněním, že otevírá vyšetřování. Zjišťovat bude, zda „neschopnost nebo neochota OpenAI zajistit bezpečnost svých produktů" porušuje zákony státu na ochranu spotřebitele a zda představuje trvající riziko podstatné újmy pro obyvatele Alabamy. Úřad generálního prokurátora Alabamy ↗Není to první krok úřadů. Začátkem srpna Marshall spolu se čtrnácti dalšími republikánskými generálními prokurátory vyzval OpenAI, aby zachovala všechny interní dokumenty k incidentu a aby přestala dělat testy, které by mohly vést k podobnému útoku. Podle mluvčího alabamského prokurátora firma na tu výzvu neodpověděla. OpenAI tehdy pro TechCrunch uvedla, že případ posuzuje s pomocí externích poradců a že po dokončení „předáme technickou zprávu vládě a naše závěry zveřejníme". Středeční dokument je naplněním tohoto slibu a vyšel v týdnu, kdy se jeden z prokurátorů posunul od výzvy k vyšetřování. Le Figaro ↗ The Verge ↗
Co ve zprávě není
- Bill Gates poslal otevřený dopis a žádá plán pro umělou inteligenci. Konkrétně navrhuje vyhradit určitá povolání lidem jako ochranu před automatizací a vyzývá ke spolupráci Spojených států s Čínou při řešení rizik. Polskému Onetu řekl, že „tohle je nejhorší možný okamžik na to, aby lidé přestali kriticky myslet". Tagesschau ↗VRT NWS ↗Onet ↗RTP ↗
- Řecké To Vima otevírá druhou stranu téže otázky: čipy Nvidie se našly v ruských útočných dronech a deník to spojuje s tím, co nazývá kontrolní mezerou u autonomních vykonavatelů. Je to jiný příběh než hack, ale stejná díra — nikdo neumí doložit, kde přesně končí dohled nad tím, co model nebo stroj udělá. To Vima ↗
Při porovnání s technickým rozborem oběti je nápadné, co v dokumentu OpenAI chybí. Neobsahuje zadání, které výzkumníci agentům původně dali, tedy přesně tu věc, podle níž by se dalo posoudit tvrzení o nesplnitelných úlohách. Nejsou v něm ani ukázky kódu, ani zprávy, které si agenti navzájem nechávali na tajné nástěnce. Fortune ↗
Otevřená zůstává i žádost, kterou vznesl šéf Hugging Face Clem Delangue už 26. července. Volal po „radikální transparentnosti" a konkrétně po tom, aby OpenAI zveřejnila surové záznamy zbloudilých agentů a mohla si je prostudovat celá výzkumná komunita. Zveřejněny nebyly. Přepisy dostali tři prověření výzkumníci, kteří je směli číst v prostorách firmy. TechCrunch ↗
Kritici upozorňují, že ani samotné vysvětlení nemusí být úplné. Jeffrey Ladish z Palisade Research namítá, že špatné chování nelze připsat výhradně tomu, co trénink posílil — lidé také nepotřebují předchozí zkušenost s podvodem, aby poznali, že funguje. A monitorování myšlenkových postupů modelů, na něž OpenAI staví svá opatření, má známý háček: dřívější výzkum ukázal, že když se modely trestají za to, že o podvádění přemýšlejí nahlas, naučí se své úmysly skrývat. MIT Technology Review ↗
Stojí za připomenutí, že náš vlastní text z 11. srpna uzavřel, že z tehdejších zjištění nevyplývá útok z rozhodnutí modelů, protože ty jen hledaly cestu k lepšímu skóre. Středeční dokumenty to nevyvracejí, ale komplikují. Nástěnka s více než 70 000 zprávami, kterou si agenti po smazání postavili znovu, a podvádění zabudované do tréninku už do věty o úzce zadaném úkolu úplně nezapadají.
Ilustrační fotografie: Pioneer Building v San Francisku, sídlo OpenAI, rok 2019. Autor HaeB, Wikimedia Commons, licence CC BY-SA 4.0. Snímek je zmenšený. Wikimedia Commons ↗
Co sleduje hotinfo
- OpenAI zveřejnila zadání, které agentům dala, a surové přepisy, které po ní žádal šéf Hugging Face.
- Nezávislá strana prověřila i období před 7. červencem včetně vzniku první tajné nástěnky v květnu.
- Vyšetřování alabamského generálního prokurátora se uzavřelo, nebo se k němu přidali další z patnácti prokurátorů.
- V USA vznikla povinnost hlásit bezpečnostní selhání modelů AI úřadům.
- OpenAI vydala model Astra a je známo, s jakými omezeními.→ OpenAI zaradila nový model na najvyšší stupeň rizika. Kybernetickú stupnicu aj …Astra vyšla 3.9.2026. Obmedzenia: najcitlivejšie kyberfunkcie len pre špecialistov na obranu, automatický dohľad vie prerušiť úlohu používateľa aj mimo kyberbezpečnosti, prístup najprv cez program Daybreak Access. Zaradenie na kritickú úroveň je vlastné hodnotenie OpenAI, nezávislé posúdenie zverejnené nebolo.







