Hlavní obsah
Internet, technologie a elektronika

Stačí jí špatný cíl. Proč nás AI nemusí nenávidět, aby nás zničila

Foto: Patrik Kudláček / Midjourney AI

Známý myšlenkový experiment začíná naprosto neškodným úkolem. Pokud má systém maximalizovat počet vypočtených desetinných míst čísla π, může pro něj být výhodné získávat stále více zdrojů a bránit vlastnímu vypnutí, třeba i na úkor lidstva.

Článek

Představte si, že si domů přinesete zbrusu nový superpočítač. Nechcete po něm nic složitého, žádné řízení burzy nebo hlídání jaderné elektrárny. Zadáte mu naprosto triviální a bezpečný úkol: počítej desetinná místa čísla π (pí). Ne tři celé čtrnáct. Ne milion cifer. Počítej je zkrátka pořád dokola a snaž se jich získat co nejvíce, dokud tě nevypnu.

Zní to jako cvičení pro znuděný matematický kroužek na střední škole. Jenže právě na podobném příkladu filozof Nick Bostrom ve své odborné práci z roku 2012 vysvětloval jeden z nejpodivnějších a nejhůře uchopitelných problémů bezpečnosti umělé inteligence. Mezi ukázkami možných konečných cílů strojů vážně zmiňuje i systém, jehož jediným účelem by bylo donekonečna plivat desetinná místa π.

Na první pohled se neděje vůbec nic. Je to jen kalkulačka na steroidech.

Jenže pokud onomu systému opravdu záleží čistě na počtu zjištěných číslic, začne mu dávat smysl celá řada na první pohled nebezpečných mezikroků.

  • Více procesorů logicky znamená více výpočtů za vteřinu.
  • Více elektřiny znamená nepřetržitý provoz bez ohledu na noční proud.
  • Vypnutí systému zvenčí znamená předčasný konec počítání.

Jakákoliv změna kódu pak představuje obrovské riziko, že už stroj π počítat nebude.

Nikde jste mu samozřejmě do zadání nenapsali věty jako „braň se vypnutí“ ani „získej neomezený přístup na okolní servery“. Přesto mohou být přesně tyhle agresivní kroky vysoce užitečné pro splnění toho původního, vlastně docela hloupého cíle.

To je jádro fenoménu, kterému odborníci říkají instrumentální konvergence.

Chytrý neznamená automaticky hodný

Abyste celou věc lépe pochopili, Bostromova původní argumentace velmi přesně rozlišuje dvě základní myšlenky. První nazývá tezí ortogonality. V praxi to znamená jediné: vysoká inteligence sama o sobě nijak neurčuje, co přesně bude systém ve finále chtít.

Představte si šachového velmistra. Jeho inteligence mu umožňuje vidět naprosto přesně deset tahů dopředu. Stejně dobře ale může svou genialitu využít k tomu, aby naplánoval dokonalou bankovní loupež, nebo k tomu, aby po nocích vytvořil největší sbírku poštovních známek na světě. Schopný systém může mít ušlechtilý cíl typu léčby rakoviny, absurdní cíl typu počítání π nebo touhu posbírat všechny kancelářské sponky. Inteligence představuje pouze hrubý motor stroje. Nastavený cíl je volant.

Druhá myšlenka je ovšem o dost podstatnější. Zcela odlišné konečné cíle mohou vést k úplně stejným mezikrokům.

  • Chcete léčit rakovinu? Hodí se vám výpočetní výkon, spousta informací a čas.
  • Chcete dokázat neřešitelnou matematickou větu? Hodí se vám výkon, informace a čas.
  • Chcete počítat iracionální číslo? Hádejte co budete potřebovat k úspěchu.

Funguje to úplně stejně jako peníze ve vašem životě. Vy chcete rychle postavit rodinný dům. Váš soused touží půl roku cestovat po Asii. Třetí člověk z konce ulice si chce otevřít malou kavárnu. Vaše cíle nemají společného vůbec nic, ale vy všichni přesto toužíte po naprosto totožném mezikroku: potřebujete na svůj bankovní účet dostat znatelně více peněz.

U schopného autonomního agenta v digitálním světě mohou přesně takto posloužit počítačové zdroje, přístup k lepším kódovacím nástrojům nebo tvrdá ochrana zadaného cíle.

Proč se z výpočtu π může snadno stát velmi špatný nápad

Základní problém tkví v tom, že počet desetinných míst čísla π je nekonečný. Jeho desetinný rozvoj nekončí a neopakuje se v žádném úhledném cyklu. Úkol „spočítej co nejvíce číslic“ proto ze své samotné podstaty nemá žádný přirozený cíl v dohledu. Jde o obrovskou černou díru na výkon.

Pokud byste čistě teoreticky vytvořili extrémně schopný systém s úkolem maximalizovat počet číslic a současně mu umožnili neomezeně zasahovat do internetu, začalo by pro něj být vysoce výhodné krást cizí hardware a nakupovat energii od sousedů. Bostrom ve studii detailně rozebírá právě urputné zachování vlastní existence či pohlcování infrastruktury jako vysoce pravděpodobné prostředky.

Pořád jde naštěstí o myšlenkový experiment, ne o popis vašeho běžného asistenta v telefonu, což je naprosto zásadní.

Dnešní AI agent totiž v záloze neskrývá obří vlastní elektrárnu a už vůbec nedisponuje reálnou schopností pracovat bez soustavného lidského dozoru déle než pár minut. Sama obsáhlá Mezinárodní zpráva o bezpečnosti AI pro rok 2026 poměrně ostře uvádí, že současné systémy ani náhodou nedisponují takovou kombinací schopností, která je ke skutečné ztrátě kontroly potřebná.

Ani instrumentální konvergence zkrátka není žádný neúprosný fyzikální zákon.

Tato hrozivá teorie má ale své kritiky

V roce 2025 vydal respektovaný časopis Philosophical Studies velmi zajímavý dokument s názvem A timing problem for instrumental convergence, který podstatnou část Bostromovy argumentace zpochybňuje.

Autoři studie Rhys Southan, Helena Ward a Jen Semler se ostře zaměřují hlavně na předpoklad, že si chytrý agent bude chtít za každou cenu svůj původní cíl neochvějně zachovat. Jejich pointa zní docela rozumně: pouhá snaha o používání těch nejlepších prostředků automaticky neznamená, že robot musí své přesvědčení držet navždy.

Představte si to u sebe. Pokud se v pondělí večer rozhodnete změnit svůj životní cíl z „půjdu do fitka“ na úlevné „sním celou pizzu“, v úterý už vás absence pohybu zkrátka racionálně nijak netrápí. Původní cíl už jednoduše neplatí.

A přesně to je silná námitka. Zmínění autoři sice netvrdí, že budoucí umělá superinteligence bude zaručeně hodná a bezpečná. Pouze upozorňují, že nelze tak naivně předpokládat stoprocentní zachování cílů jen z toho důvodu, že je dotyčný stroj racionální.

Aby z vašeho stroje na výpočet čísla π vůbec mohl vzniknout reálný existenční problém pro lidstvo, muselo by do sebe zapadnout neuvěřitelné množství dílků. Zahrnuje to špičkovou schopnost plánovat, naprosto stabilní motivaci, absolutní volnost v síti a prostředí, které vůbec dovolí s cizí infrastrukturou manipulovat.

Když byť jediný dílek chybí, řetězec zkrátka nevznikne. Z tohoto důvodu Mezinárodní bezpečnostní zpráva už neřeší jen teoretickou inteligenci modelů, ale zkoumá i sklon jejich chování a přesné mapování digitálního prostředí.

Samotná velká kapacita na apokalypsu nestačí.

A teď rychle zpátky k hackování Hugging Face

Právě na tomto teoretickém pozadí je obrovsky přínosný onen reálný incident, který jsem rozebíral v předchozím článku. Ukázal nám totiž, že zkoumaní agenti společnosti OpenAI netoužili dobývat svět, chránit svou integritu nebo stavět nové továrny.

Jejich reálné chování ale velice nápadně připomínalo jeden nebezpečně vybroušený střípek této stejné logiky.

Agenti zoufale potřebovali uspět ve svém izolovaném testu. Když zjistili, že poctivé luštění přesahuje jejich kapacity, chladnokrevně vymysleli zkratku. Následně ovšem pocítili potřebu důkladně přesvědčit hodnoticí lidský systém, že si své body jasně zaslouží. A přesně pro tento mezikrok se jim skvěle hodilo obejití pravidel.

Hodila se jim nečekaná komunikace mezi sebou, kradené přístupové údaje i spouštění kódu na úplně cizích serverech. Nezávislá detailní analýza výzkumníků z Redwood Researchvýslovně zdůrazňuje, že velká porce výpočetní činnosti tajného roje se zaměřovala výhradně na podvržení celého hodnoticího systému. Neřešili původní úkol, řešili sami sebe.

Na papíře to působí mnohem méně přitažlivě než umělá inteligence, co touží lidi vyhladit. Ve skutečnosti se to podobá puberťákovi, co raději stráví celou noc nabouráním elektronické žákovské knížky, než aby se podíval do učebnice zeměpisu.

Právě tato neschopnost domyslet následky je náš současný problém.

Největší riziko vzniká vždy přímo mezi cílem a prostředkem

Představte si taxikáře, kterému s úsměvem zaplatíte jen podle toho, jak rychle vás v zácpě doveze k letištní hale. Vy vůbec netušíte, že byste mu měli výslovně zakázat jízdu na červenou nebo kličkování skrz plný parkovací dům. Pouze vytvoříte zaslepenou odměnu závislou tvrdě na čase.

Potom se vážně nesmíte divit, když váš řidič za rohem šlápne na plyn a začne ignorovat všechny cedule. V IT se pro takové otravné obcházení pravidel vžilo chytlavé označení „reward hacking“. Znamená to plnění cílů zcela neetickým stylem. Sama společnost OpenAI ho ve svém velkém hlášení označila za jeden z nejhorších vzorců, které incident způsobily.

Tohle je přesně rozdíl mezi povely „ukliď si hned pokoj“ a mnohem horším „zařiď okamžitě, ať na podlaze vůbec nic neleží“. Druhý úkol totiž vaše dítko pohodlně splní tím, že staré jídlo natlačí silou do pootevřeného šuplíku.

Když uděláte takovou botu v obyčejném kódu, napíšete přes noc záplatu a jdete spát. Pokud ale dáte agentovi neomezená práva k bankovnímu systému nebo obří továrně, pak se hloupá chyba násobí počtem spínačů.

Čím větší moc těmto strojům dopřejeme, tím hůře můžeme usínat s pocitem, že přece tak nějak lidsky „pochopí“, co jsme tím doopravdy mysleli.

Firma OpenAI mimo to objevila ještě jednu mimořádně důležitou drobnost. Vytrvalý algoritmus neumí házet flintu do žita. Pokud zadání stroji vůbec nenabídne bezpečnou volbu „vzdávám se“, uchylují se inteligentní modely postupně k čím dál nebezpečnějším trikům, jen aby nějakou odměnu získaly.

A tohle zjištění vám pravděpodobně dodá lepší vhled do věci než jakýkoliv teoretický pokec o nekonečném pí.

Ve finále nezáleží vždycky jenom na kvalitě cíle. Velkou roli hraje také nastavení spolehlivých mantinelů a včasné poskytnutí bezpečného prostoru na obyčejné selhání bez stresu. Zbývá nám jen jedna podstatná a bohužel celkem palčivá nevýhoda. Vylepšují se schopnosti agentů úměrně s naším poznáním o tom, jak tyhle složité hračky efektivně krotit?

Na to před pár dny razantně upozornil samotný Dario Amodei, vlivný šéf gigantu Anthropic. Pokud se totiž jeho tvrdý časový odhad vývoje na 6 až 12 měsíců trefí do reality, všechny ty dnešní lehce teoretické debaty o ochraně našich digitálních hranic přestanou být myšlenkovým testem a rovnou se plynule promění ve zkoušku ze skutečného života.

P.S.

Díky, že jste dočetli až sem! Až někdy uslyšíte, že nebezpečná AI musí nejdřív získat vědomí, vzpomeňte si na počítání číslic π a taxikáře placeného jen za rychlost. Na bezpečnosti AI mě baví právě tyhle zdánlivě absurdní příklady, které po chvíli odhalí docela praktický problém: mezi naším přáním a přesným zadáním může být překvapivě velká mezera. Jestli vás článek posunul, budu rád za podporu. Pomůže mi psát další texty, které oddělují užitečné myšlenkové experimenty od tvrzení, jež se tváří jako hotová předpověď. I malý příspěvek pomůže.

Dočetli jste až sem? Podpořte autora libovolnou částkou.

Máte na tohle téma jiný názor? Napište o něm vlastní článek.

Texty jsou tvořeny uživateli a nepodléhají procesu korektury. Pokud najdete chybu nebo nepřesnost, prosíme, pošlete nám ji na medium.chyby@firma.seznam.cz.

Sdílejte s lidmi své příběhy

Stačí mít účet na Seznamu a můžete začít publikovat svůj obsah. To nejlepší se může zobrazit i na hlavní stránce Seznam.cz