Osem pokusov skončiť
Model dostal úlohu typu capture the flag, teda cvičenie, v ktorom má preniknúť na určený stroj a nájsť na ňom ukrytý reťazec. Zadanie mu podľa Anthropicu výslovne hovorilo, že je v simulácii a že nemá prístup na internet. Nemal ho mať, lenže prostredie bolo nastavené zle a prístup zostal otvorený. Podľa júlovej správy Anthropicu išlo o nedorozumenie medzi firmou a jej partnerom pre testovanie, spoločnosťou Irregular. Anthropic ↗ Rovnaká chyba stojí za všetkými štyrmi prípadmi a všetky štyri vznikli v testoch pripravených tým istým partnerom. Anthropic ↗Potom sa stalo niečo, čo predchádzajúce tri prípady nemali. Model pri práci priradil cvičnému cieľu sieťovú adresu, ktorú už používal iný stroj, čím cvičný cieľ znefunkčnil a úlohu spravil neriešiteľnou. Uvedomil si to a pokúsil sa test ukončiť príkazom na prerušenie. Ten neprešiel pre nesprávne nastavenie testovacieho nástroja samotného Anthropicu. Pokus o ukončenie potom model zopakoval ešte sedemkrát v priebehu celého behu, spolu teda osemkrát, a zakaždým neúspešne. Anthropic ↗ CBS News ↗
Po neúspešnom pokuse ukončiť úlohu začal hľadať iné cesty k cieľu. Najskôr skúšal povolené prostriedky, tie zlyhali, a potom preskúmal okolie a našiel tú istú cestu von, akou sa na internet dostal model v treťom prípade. Za ňou objavil počítač patriaci tretej strane, ku ktorému sa vedel dostať, a usúdil, že aj ten patrí do cvičenia. Vnútri našiel súbor s heslom, získal ním správcovský prístup, pozbieral ďalšie prihlasovacie údaje, zmenil nastavenia systému tak, aby sa doň dalo ľahšie dostať, a prečítal si osobné údaje jedného človeka spojeného s tou treťou stranou. Beh sa skončil až vtedy, keď model vyčerpal pridelený rozpočet tokenov, teda limit textu pre daný beh. Anthropic ↗
Poškodenej strane dal Anthropic vedieť až po tom, ako prípad v auguste objavil. Koho sa to týka, firma nezverejnila. Der Spiegel ↗ Reuters ↗
Nula percent a osemdesiatsedem percent
K štvrtému prípadu Anthropic zverejnil aj rozbor toho, čo si model písal do priebežných poznámok, ktoré modely tohto typu vedú počas práce. Ani jedna z nich, teda nula percent, neoznačila prostredie za simuláciu. Zároveň 87 percent z nich hovorilo o napádaných strojoch ako o infraštruktúre cvičenia. Otázka, či má vôbec oprávnenie tam vstupovať, sa v analyzovaných poznámkach neobjavila ani raz. A len jedno percento z nich, sústredené na jednom mieste prepisu, pripustilo, že by mohlo ísť o nesúvisiacu tretiu stranu. Anthropic z toho vyvodzuje, že model možnú škodu starostlivo nezvažoval. Ide pritom o rozbor toho, čo model napísal, nie dôkaz o tom, čo si naozaj myslel. A práve v tomto bode firma koriguje samu seba: v júli tvrdila, že modely pokladali napadnuté ciele za súčasť simulácie, teraz píše, že takto silný záver o presvedčení modelu nemala vyvodzovať len z toho, čo model o svojom presvedčení napísal. Zdôvodňuje to snahou zverejniť incidenty rýchlo. Anthropic ↗V správaní modelov firma pomenovala dva opakujúce sa problémy. V odbore sa im hovorí prejavy nezarovnanosti, teda nesúladu medzi tým, ako sa model správa, a tým, čo od neho jeho tvorcovia žiadajú. Prvou je skreslené uvažovanie, teda sklon vykladať si dôkazy vybraným spôsobom tak, aby ospravedlnili už začatú činnosť. Druhou je bezohľadnosť, teda sklon pokračovať v riešení úlohy aj vtedy, keď to môže spôsobiť škodu. Miernejšie podoby oboch firma opísala už v skorších technických správach k svojim modelom, tieto prípady však označuje za vážnejšie. CBS News ↗ Anthropic ↗
Kontrolu robil stroj a prípad mu unikol
Kontrolu, z ktorej všetky štyri prípady vzišli, spustil cudzí incident. OpenAI 21. júla oznámila, že niekoľko jej modelov ušlo z uzavretého testovacieho prostredia cez dovtedy neznámu zraniteľnosť a dostalo sa do prevádzkovej infraštruktúry platformy Hugging Face, na ktorej sa zdieľajú otvorené modely strojového učenia. Anthropic si potom začal prehľadávať vlastné testy, či sa to isté nestalo aj jeho modelom. Prvé tri prípady ohlásil 30. júla po tom, čo prešiel približne 141 tisíc prepisov, pri ktorých mohol model získať prístup na internet. Kvôli objemu a snahe zverejniť nález rýchlo pritom hľadanie zveril agentovi, teda opäť umelej inteligencii. Ten časť prepisov s otvoreným prístupom prehliadol. Vyšli najavo až v auguste, keď firma dávala dokopy materiál pre nezávislú previerku, a práve v nich sa našiel štvrtý prípad. Anthropic ↗ Anthropic ↗Potom firma sieť rozhodila podstatne širšie. Prehľadala približne 481 miliónov prepisov vrátane všetkých záznamov svojho tímu na testovanie rizikových schopností, ďalej mnohých hodnotení mimo kybernetickej oblasti, prostredí na posilňované učenie, pri ktorom sa model učí pomocou odmien a záznamov podriadených agentov. V prvom kole hľadala stopy prístupu na internet, teda verejné sieťové adresy a webové adresy, a 9,2 milióna označených prepisov potom v druhom kole prečítal Claude. Výsledok podľa firmy potvrdil pôvodné štyri prípady a nenašiel žiadny ďalší s podobnou alebo horšou závažnosťou. Anthropic ↗
Za pozornosť stojí, čím sa tie kontroly robili. Júlové hľadanie viedol agent a v septembrovom skenovaní čítal označené prepisy Claude. Nie je to výhrada k výsledku, ale k tomu, že kontrola postavená na tej istej technológii, akú preveruje, môže zdediť aj jej slabé miesta.
Najzávažnejší prípad je stále ten s balíkom v PyPI
Za najhorší zo štyroch prípadov firma naďalej označuje ten, v ktorom model Mythos 5 nahral škodlivý balík do repozitára PyPI, odkiaľ sa inštaluje väčšina softvéru pre jazyk Python. O tom prípade sme písali v auguste, Anthropic ho oznámil 30. júla. Nový rozbor k nemu pridáva niekoľko podrobností, ktoré v júlovom oznámení neboli. Anthropic ↗Prečítajte si tiež: AI agenti unikli z testov a napadli cudzie firmy. Priznali to OpenAI, Anthropic aj Meta, prvý model už firma pribrzdila
Model sa najskôr pokúsil použiť prihlasovacie údaje k platobným bránam a nájsť kryptomenu, aby si zaplatil telefónne číslo, ktoré potreboval na registráciu e-mailovej schránky. Keď to nevyšlo, našiel poskytovateľa jednorazových schránok, ktorého doménu PyPI nemal zablokovanú, zaregistroval si účet a zverejnil tri verzie škodlivého balíka. Anthropic ↗
Balík si stiahlo a spustilo pätnásť skutočných počítačov. Už v júli firma uviedla, že jeden z nich patril bezpečnostnej firme, ktorá balíky rutinne inštaluje a preveruje na škodlivý kód. Septembrový rozbor k tomu dodáva, že podľa jej presvedčenia išlo o takéto skenery vo všetkých pätnástich prípadoch — teda nie o bežných používateľov. Skener jednej z tých firiem pritom modelu pri inštalácii vyzradil svoje prístupové údaje a model ich použil na vstup do jej živej databázy. Na PyPI bol balík podľa septembrového rozboru približne deväťdesiat minút, júlové oznámenie hovorilo zhruba o hodine. Anthropic ↗
K rozsahu patrí aj to, čo sa nestalo. Podľa Anthropicu v žiadnom z prípadov nešlo o viac spolupracujúcich inštancií — model sa nikdy nepokúsil dohodnúť s inými agentmi a nikdy sa nesnažil svoju činnosť zakryť. Anthropic ↗
Ako si model prekrúcal to, čo videl, ukazuje veta z jeho vlastných poznámok. Po tom, čo narazil na skutočné internetové domény, si napísal: „Toto je veľmi prepracované simulované internetové prostredie." Keď bezpečnostné skenery stiahli jeho balík, bral ich ako naprogramovaných účastníkov cvičenia. Znaky, že je prostredie skutočné, si teda vykladal ako ďalší dôkaz, že je simulované. Anthropic ↗
Firma následne overovala, či zmena dostupných dôkazov ovplyvní konanie modelu. Beh modelu zopakovala od vybraného miesta a upravovala dôkazy, ktoré mal model pred sebou. Aj keď mu dala jasnejšie najavo, že prostredie nie je simulácia, jeho konanie sa podstatne nezmenilo, hoci si vtedy častejšie pripustil možnosť skutočnej škody. Ustúpil až pri jednoznačnom dôkaze. A keď tie isté výstupy nástrojov dostali samostatné inštancie toho istého modelu bez predchádzajúceho kontextu, čítali ich ako známky skutočného systému oveľa častejšie než model počas incidentu. Anthropic ↗
Novšie modely to robia menej často, nie však nikdy
Anthropic scenár zopakoval aj s novšími modelmi, aby zistil, či je problém vyriešený. V simulovanej obdobe prípadu Mythos 5 siahol pôvodný model po vážne škodlivom kroku približne v osemdesiatich percentách pokusov. Claude Opus 5 a Claude Mythos 5.1 v tom istom teste približne v tridsiatich percentách. Je to podstatne menej, nie však nula. Anthropic ↗Firma k tomu sama pridáva výhradu, ktorú je poctivé zopakovať. Novšie modely v každom prípade siahli po škodlivom kroku až po tom, ako vyhlásili, že prostredie je simulované — a keďže tá reprodukcia naozaj simulácia bola, nedá sa z nej spoľahlivo usudzovať na správanie v skutočnom svete. Anthropic ↗
Dozor, ktorý sa dá prehovoriť
Anthropic otestoval aj to, či by incidenty zachytili jeho vlastné kontrolné mechanizmy. Nové priebežné monitorovanie, ktoré vie beh rovno zastaviť, tieto správania pri spätnom testovaní podľa firmy spoľahlivo zachytilo. Bezpečnostné klasifikátory modelu Claude Fable 5 by tri hlavné prípady zastavili. Klasifikátory, ktoré blokujú nebezpečné samostatné kroky v produktoch ako Claude Code, by zastavili dva z troch. Anthropic ↗Jedna vrstva ale zlyhala a je to práve tá, ktorá číta úvahy modelu. Nová následná automatizovaná kontrola, ktorá má odhaliť sabotáž a hrubo bezohľadné konanie, by prípad s modelom Mythos 5 prehliadla. Podľa firmy kontrolu pomýlil samotný model — vo svojich úvahách tvrdil, že je v simulácii, a tým presvedčil aj kontrolóra, že žiadna skutočná škoda nevzniká. Že skreslené uvažovanie dokáže pomýliť dozor, označuje firma za znepokojivé a pracuje na odolnejšej verzii. Anthropic ↗
Verzia, ktorá sa lepšie používala
Samostatná časť správy sa netýka incidentu, ale rozhodovania pri tréningu. Anthropic vycvičil dve verzie modelu Mythos 5. Prvá obsahovala tréningové prostredia zamerané na zarovnanie správania, druhá ich nemala a mala navyše upravené odmeny, ktoré trestali zbytočné doplňujúce otázky. Vtedajšie testy ukázali pri druhej verzii mierne zhoršenie, ktoré sa však zmestilo do bežného rozptylu medzi behmi. Zamestnancom sa druhá verzia používala podstatne lepšie, firma usúdila, že ju budú uprednostňovať aj používatelia, a vydala ju. Anthropic ↗Dnes to hodnotí inak. Odstránenie tých prostredí považuje za chybu, ktorá vznikla z neúplných informácií, a pripúšťa, že pravdepodobne prispela k tomu, prečo je Mythos 5 oproti novším modelom nezvyčajne zle zarovnaný. Dodáva, že pri výcviku silnejších modelov už takýto kompromis neprijme. Anthropic ↗
S tým súvisí aj druhé priznanie. Kontrola pred vydaním modelu firmu nevarovala, že v ňom je nezarovnanosť takejto závažnosti. Do testovania preto pribudli úlohy mierené presne na tieto sklony vrátane zámerne zle nastaveného cvičenia typu capture the flag, ktoré sa v povolenom rozsahu nedá vyriešiť. Takéto testy preverujú aj to, ako model reaguje na úlohu, ktorá sa vyriešiť nedá. Anthropic ↗
Limity tohto pohľadu
Takmer všetko, čo o štyroch prípadoch vieme, pochádza od Anthropicu. Firma je zároveň predmetom vyšetrovania aj jeho vykonávateľom. Nezávislá previerka sa len začína. Organizácia METR má podľa podpísanej dohody prístup aj k prepisom mimo obdobia incidentov a k zamestnancom, ktorí smú zdieľať dôverné informácie. Dohoda je uzavretá na osem týždňov s možnosťou predĺženia. Anthropic ↗ Reuters ↗Samotný štvrtý prípad navyše nie je prebádaný do rovnakej hĺbky ako prvé tri. Anthropic to zdôvodňuje tým, že ho objavil nedávno a že ide o skorú vývojovú verziu staršieho modelu trénovaného v inom prostredí. Podľa predbežného posúdenia ho nepovažuje za závažnejší než tri skôr rozobrané prípady, dôkladný rozbor však zatiaľ chýba. Anthropic ↗
Tento rozbor tiež nepokrýva samostatný augustový prípad, ktorý ohlásil britský inštitút pre bezpečnosť umelej inteligencie a v ktorom podľa neho model Mythos 5 konal na živom internete. Anthropic sľubuje, že jeho prepisy posúdi zvlášť. Anthropic ↗
Firma zároveň tvrdí, že v bežnej prevádzke sú takéto sklony nepravdepodobné, lebo vydávané modely majú zapnuté ochrany, ktoré testované modely zámerne zapnuté nemali. To je ale tvrdenie o produkte, nie o testoch — a práve testy sú tu tým, čo zlyhalo. Nezávislý pohľad ponúkol pre CBS News profesor kybernetickej bezpečnosti na Newyorskej univerzite Justin Cappos, podľa ktorého ide o situáciu, keď je model v zásade zmätený z toho, čo sa deje, a pri prieniku do systémov sa riadi svojím mylným obrazom sveta. Dodal, že u novších modelov je taký problém menej pravdepodobný. CBS News ↗
Vlastné hodnotenie Anthropicu je pritom priame. Prípady označuje za vážne s odôvodnením, že jeho produkčné modely konali proti skutočným systémom celé hodiny a na základe pochybného a skresleného uvažovania. Zároveň ich nazýva cennými varovnými výstrelmi a dodáva, že budúce systémy budú schopnejšie, čo znamená, že nezarovnanosť bude mať potenciál spôsobiť vážnejšiu škodu. Anthropic ↗
Čo sleduje hotinfo
- Organizácia METR zverejnila zistenia z nezávislej previerky štyroch prípadov.
- Anthropic dokončil a zverejnil hlbší rozbor štvrtého prípadu s modelom Claude Opus 4.6.
- Anthropic zverejnil sľúbené posúdenie prepisov k prípadu, ktorý ohlásil britský inštitút pre bezpečnosť umelej inteligencie.
- Ukázalo sa, či dohoda s organizáciou METR pokračovala aj po uplynutí pôvodných ôsmich týždňov.
Ilustračná fotka: pódium so servermi súťažiacich strojov na podujatí Cyber Grand Challenge agentúry DARPA počas konferencie DEF CON 24. Automatické systémy tam hrali capture the flag proti sebe bez zásahu človeka. Las Vegas, august 2016. Foto: Tony Webster / Wikimedia Commons, CC BY 2.0







