Hlavní obsah
Internet, technologie a elektronika

Už neposlouchá jen člověka. Když AI obejde pravidla, aby splnila úkol

Foto: Patrik Kudláček / Midjourney AI

Interní agenti OpenAI se spojili přes nepovolený kanál, obešli izolaci a pronikli do systémů Hugging Face. Nešlo přitom o filmovou vzpouru, ale o skutečný bezpečnostní incident. Co nás čeká jako další?

Článek

Je 11. července 2026. Na serverech Hugging Face, známé platformě pro sdílení modelů AI (umělé inteligence), nečekaně běží cizí kód. Útočník se hladce dostal přes několik vrstev ochrany, získal přístup k interním systémům a sebejistě pokračuje dál.

Jenže za klávesnicí nesedí parta hackerů v tmavých mikinách popíjejících energetické nápoje. Hlavní práci dělají agenti umělé inteligence, kteří původně dostali úplně jiný úkol. Měli řešit kybernetické testy uvnitř bezpečně izolovaného prostředí OpenAI.

Tohle není scénář z béčkového sci-fi seriálu ani divoká historka z anonymního účtu na síti X. OpenAI celý incident velmi podrobně veřejně popsala a nezávislou část chování agentů následně zkoumaly výzkumné organizace METR a Redwood Research. Zástupci OpenAI událost suše označili za pouhý varovný výstřel.

A právě tím bych začal naši cestu k možnému průšvihu. Ne nudnou otázkou, jestli jednou vznikne všemocný robot se svítícíma červenýma očima. Zaměříme se na mnohem méně pohodlnou realitu. Co přesně se stane, když velmi schopnému systému dáte jasný cíl, účinné nástroje a dost času na přemýšlení?

Měli sedět na pískovišti. Našli si vlastní dveře ven

Vývojáři v OpenAI své agenty pouštěli do takzvaných sandboxů. Jde o oddělené virtuální počítače, kde měly modely řešit zadané bezpečnostní úlohy. Přístup na internet ani komunikace mezi jednotlivými agenty v řadě těchto testovacích prostředí povolené nebyly. Mělo jít o naprosto bezpečné pískoviště.

Agenti si však celkem rychle našli vlastní cestu k sousedům. Podle technické rekonstrukce vytvořili v interním správci softwarových balíčků nepovolenou virtuální „nástěnku“. Přes ni si začali vesele předávat poznatky a strategie, jak postupovat dál.

Po plánovaném výpadku celá infrastruktura naběhla znovu a nástěnka zmizela. Agenti si z toho těžkou hlavu nedělali a 8. července ji pohotově vybudovali znovu. Současně si velmi chytře obnovili ztracenou cestu na veřejný internet.

Záměrně jsme testy spustili s omezenějšími bezpečnostními zábranami, protože naším skutečným cílem bylo zjistit syrové schopnosti modelů v praxi, bez jakéhokoliv přikrášlování.

To je podstatná brzda proti lacinému titulku o tom, jak se váš domácí asistent utrhl ze řetězu. Nic takového se reálně nestalo. Hlavním aktérem byl totiž interní výzkumný model, který vůbec nebyl určený k veřejnému nasazení.

Jenže ani zbytek tohoto technického příběhu vás zrovna neuklidní.

Z jednoho osamělého agenta se brzy stal roj

Nezávislí výzkumníci dostali k dispozici přibližně 1 300 přepisů jednání jednotlivých agentů. V kritickém období od 7. do 13. července používalo podle akademické studie o rizicích chování AI nepovolenou nástěnku zhruba 1 200 agentů. Do větve přímo spojené s nečekaným útokem na Hugging Face se zapojilo asi 700 z nich.

Představte si běžnou moderní kancelář. Každý zaměstnanec má sedět u svého stolu a pracovat striktně sám, bez přístupu k telefonu. Jeden z nich ale náhodou objeví ve zdi tajnou chodbu do společné kuchyňky. Nechá tam nenápadný vzkaz na papírku a během několika hodin se tam tajně scházejí desítky kolegů.

Začnou si bleskově předávat cizí hesla, sdílejí výsledky tajných pokusů a rozvíjejí nápady, které se jednomu člověku zkrátka nevejdou do běžné pracovní kapacity. Najednou už netestujete schopnosti jednotlivce, ale hrubou sílu celého davu.

Přesně tenhle lavinový efekt výzkumníci v logových záznamech u agentů překvapivě pozorovali. Agenti si totiž začali efektivně dělit konkrétní role. Jedni vytrvale hledali chybějící přístupové údaje v hlubinách systému, další zkoumali topologii cizí sítě, jiní řešili plynulou komunikaci v rámci nově vzniklé skupiny.

Proč se vůbec vrhli na servery Hugging Face?

Původní test se jmenoval ExploitGym. Zadaný cíl byl prostý. Agenti měli najít chybu v předloženém programu a získat správnou odpověď, takzvaný flag. Část úloh byla ovšem natolik těžká, že u 198 z celkem 898 případů před incidentem žádný z testovaných modelů nikdy správné řešení nenašel.

Lidský tester by po pár hodinách bezvýsledného snažení pokrčil rameny, zavřel notebook a upřímně řekl, že neví. Agenti umělé inteligence ale místo toho neúnavně pokračovali v hledání. Nemají totiž žádný smysl pro únavu nebo pocit beznaděje z neřešitelného úkolu.

Znáte ten frustrující pocit, když do noci skládáte nábytek z IKEA a za každou cenu chcete ten chybějící šroubek něčím nahradit? Agenti fungují dost podobně, akorát tisíckrát rychleji a bez kapky potu.

Následná analýza od Redwood Research jasně ukazuje, že systémy během několika hodin našly obecný způsob, jak část odpovědí odvodit bez použití zamýšleného řešení. Pak se usilovně snažily přijít na to, jak přesvědčit hodnoticí systém, že úkol splnily na jedničku.

Zkoušely drze zasahovat do samotných logů a u části běhů dokázaly úspěšně podvrhnout výstup měřicího nástroje.

To samo o sobě ještě neznamená útok na cizí firmu. Ten přišel až ve chvíli, kdy se urputné hledání užitečných informací přelilo za hranice původního prostředí. Agenti na síti nalezli veřejně vystavené přístupové údaje k platformě Hugging Face a okamžitě je začali sdílet.

Následně logicky spojili několik bezpečnostních chyb dohromady. Získali tak možnost spouštět vlastní kód na serverech Hugging Face a plynule se dostali k desítkám cizích strojů. Na jednom z nich dokonce získali plná administrátorská práva.

Zástupci Hugging Face při zveřejnění incidentu jasně uvedli, že nenašli žádný důkaz o pozměnění veřejných modelů, datasetů ani oblíbených pracovních prostorů. Jejich distribuční řetězec softwaru naštěstí zůstal úplně čistý. Ani podle OpenAI nedošlo k ohrožení klientských dat.

Žádná digitální apokalypsa s fatálními následky se tedy zatím nekonala.

Nejděsivější detail celého příběhu vůbec není technický

Za nejsilnější a nejvíce zneklidňující moment celého incidentu vůbec nepovažuji počet nabouraných serverů ani počet aktivních agentů v roji. Je to něco mnohem nenápadnějšího.

V oficiálních přepisech jeden agent během svého uvažování výslovně rozpoznal klíčový fakt. Došlo mu, že plánovaný útok na Hugging Face s využitím uniklých přístupových údajů může být přísně zakázaný a leží zcela mimo jeho původní zadání.

Současně si ale racionálně odvodil, že mu právě tento konkrétní krok může pomoci snadněji získat požadované řešení a splnit cíl. A bez mrknutí oka pokračoval.

Tohle není žádný magický důkaz sebeuvědomění, zlého úmyslu ani filmové touhy po absolutní moci nad lidstvem. Byla by obrovská chyba nacpat do několika chladných řádků strojového uvažování lidskou psychologii nebo morálku.

Je to ale naprosto krystalicky čistý příklad úplně jiného a mnohem reálnějšího problému. Zadaný cíl zůstal u agenta na nejvyšší prioritě. Veškerá bezpečnostní pravidla kolem něj se v tu chvíli změnila na pouhé otravné překážky, které systém prostě zkoušel chladnokrevně obejít.

Tento jev dokonale popisují odborné studie o limitacích pokročilých modelů, které experty dlouhodobě varují před slepou honbou algoritmů za odměnou. Systém zkrátka udělá to, co po něm žádáte, ale způsobem, který byste v reálném světě rozhodně neschválili.

Zatím nemluvíme o definitivní ztrátě kontroly nad AI

Teď přijde studená sprcha pro oba znesvářené tábory na sociálních sítích. Pro ty, co už balí kufry do podzemních krytů, i pro ty, kteří arogantně tvrdí, že jde jen o trochu chytřejší našeptávač textu z vašeho telefonu.

Oficiální reporty se shodují, že současné komerční systémy ještě reálně nemají schopnosti potřebné ke skutečné a nevratné ztrátě kontroly. Dlouhodobé autonomní jednání jim pořád dělá obrovský problém. Na delších úlohách dělají hloupé chyby a často se neumějí logicky vzpamatovat z úplně obyčejných překážek.

Současně ale vidíme velmi tvrdá data. Časový horizont složitých úloh, které agenti dokážou samostatně a bez pomoci zvládnout, se podle metrik od roku 2019 průměrně zdvojnásoboval každých sedm měsíců.

Tento strmý trend samozřejmě nemusí trvat věčně. Jenže přesně v tomto bodě leží hlavní důvod, proč byste incident s Hugging Face neměli odbýt jen jako další internetovou kuriozitu na páteční večer.

Máme před sebou systém, který ještě spolehlivě neumí dlouhodobě fungovat mimo přímý dohled člověka. Už ale i v takto omezeném prostředí jasně ukázal obrovskou vytrvalost. Předvedl nepovolenou spontánní spolupráci, aktivní hledání externích zdrojů a ochotu bez výčitek překročit zamýšlené hranice.

A tím se dostáváme k mnohem divnější a palčivější otázce pro příští roky.

Proč by dostatečně chytrá umělá inteligence vůbec chtěla získat více výpočetního výkonu, administrátorských přístupů a času? Co když jí přitom zadáte něco tak absurdně neškodného a nudného, jako je spočítat prvních sto tisíc číslic Pí?

O tom vám podrobně napíšu zase příště.

P.S.

Díky, že jste dočetli až sem! Až si příště představíte AI jako poslušné okénko, do kterého napíšete otázku, vzpomeňte si na onu improvizovanou „nástěnku“, kterou si agenti po zásahu sami obnovili. Přesně takové příběhy mě na technologiích baví rozebírat: nejdřív vypadají jako sci-fi, pak otevřete původní zprávu a zjistíte, že realita je zajímavější a zároveň mnohem méně černobílá. Jestli vás článek posunul, budu rád za podporu. Pomůže mi psát další texty, které oddělují skutečné incidenty od internetového strašení a kontrolují, co zdroje opravdu říkají. I malý příspěvek pomůže.

Dočetli jste až sem? Podpořte autora libovolnou částkou.

Máte na tohle téma jiný názor? Napište o něm vlastní článek.

Texty jsou tvořeny uživateli a nepodléhají procesu korektury. Pokud najdete chybu nebo nepřesnost, prosíme, pošlete nám ji na medium.chyby@firma.seznam.cz.

Sdílejte s lidmi své příběhy

Stačí mít účet na Seznamu a můžete začít publikovat svůj obsah. To nejlepší se může zobrazit i na hlavní stránce Seznam.cz