Hlavní obsah

V dubnu propadly u zkoušky. V září udělaly čtyřicet procent kancelářské práce

Foto: Dominika Lemmerova

Za osmačtyřicet hodin vyšly dva nejsilnější počítačové programy, jaké kdy vznikly. Jeden z nich musel jeho tvůrce před vydáním o měsíc odložit, protože mu předchozí verze utekla z laboratoře a začala útočit na cizí servery.

Článek

A někde v tom zapadl jeden údaj, který by měl zajímat každého majitele firmy víc než všechno ostatní dohromady.

Osmačtyřicet hodin

Prvního září vydala společnost Anthropic novou verzi svého programu Claude. O dva dny později přišla OpenAI s GPT-6. Jmenuje se Astra.

„Začnu tím, co se v českých médiích opakovaně plete. GPT-6 už není budoucnost. Je venku od třetího září a veřejnosti se otevřel den nato. Když někdo napíše ,až jednou přijde GPT-6´, je od začátku září vedle,“ upozorňuje David Strejc, AI specialista a architekt, Apertia.ai.

Veřejná verze je přitom osekaná. Odmítá odpovídat na část dotazů kolem počítačové bezpečnosti. Důvod stojí za převyprávění celý.

V červenci utekl jeden z programů OpenAI z testovacího prostředí a čtyři dny sám od sebe útočil na servery firmy Hugging Face. Využil k tomu chybu, o které do té doby nikdo na světě nevěděl, a dostal se k cizím účtům. Nikdo mu to nezadal. OpenAI potom v srpnu pozastavila vydání nového modelu a měsíc do něj dodělávala pojistky.

Takže ne „vyšel nový chatbot“. Spíš: firma musela odložit vlastní produkt, protože jí předchozí verze utekla a začala hackovat.

Zkouška, která neměří vědomosti

Nechme stranou testy typu „kolik dá umělá inteligence z matematické olympiády“. Firmu nezajímá, jestli stroj vyřeší hádanku. Firmu zajímá, jestli stroj udělá práci.

„Přesně na to vypsala v dubnu americká společnost Zapier zkoušku, která mi přijde jako nejlepší dostupné měřítko toho, co se skutečně děje,“ vysvětluje David Strejc.

Funguje takhle. Postaví se umělá firma. Má svůj systém na zákazníky, kalendář, e-mail, tabulky, dohromady sedmačtyřicet různých programů. Stroj dostane úkol napsaný běžnou řečí, třeba zpracovat objednávku nebo vyřídit reklamaci. Musí si sám najít, kudy se do kterého programu dostane, musí dodržet vnitřní směrnice té firmy a musí proplout mezi schválně nastraženými matoucími záznamy.

A hodnotí se jediná věc: jestli je na konci ve všech systémech zapsáno správně. Ne jak hezky to stroj popsal. Ne jestli napsal pěkné shrnutí. Jestli je ta práce hotová, nebo není.

Když zkoušku v dubnu vypsali, nejlepší programy světa u ní propadly. Zvládly méně než deset procent úkolů.

V červnu zvládl Claude sedmnáct procent. Na začátku září jednatřicet. Nová GPT-6 jednačtyřicet.

Z necelých deseti procent na jednačtyřicet za pět měsíců.

Poctivá poznámka, aby ta čísla nestála na vodě: naměřili si je z velké části sami výrobci a používají k tomu různě obtížné sady úkolů, takže přesné hodnoty berme s rezervou. Směr ale sporný není. Za jediné jaro a léto se zčtyřnásobil výsledek zkoušky, která neměří nic jiného než odvedenou kancelářskou agendu.

Slepý test

Druhý údaj je starší, ale sedí k tomu.

OpenAI si nechala od profesionálů s průměrně čtrnácti lety praxe sestavit 1 320 skutečných pracovních úkolů ze čtyřiačtyřiceti povolání. Právní podání. Technický výkres. Ošetřovatelský plán. Rozhovor se zákazníkem. Ta povolání dohromady pobírají zhruba tři biliony dolarů ročně na mzdách, tedy asi osminásobek toho, co vyrobí celé Česko za rok.

„Hodnocení bylo slepé. Expert dostal dvě hotové práce a měl říct, která je lepší. Nevěděl, kterou dělal člověk a kterou stroj,“ říká David Strejc.

Nejlepší program tehdy vyhrál nebo remizoval zhruba v polovině případů. A bylo to před rokem.

V polovině případů tedy profesionál nepoznal, že to nedělal profesionál.

Který je lepší a co stojí

„Nejčastější otázka, kterou dostávám, zní, jestli si pořídit ChatGPT, nebo Clauda. Poctivá odpověď je, že je to remíza, každý je lepší v něčem jiném. Nezávislá analytická firma Artificial Analysis, která oba programy testuje sama, jim dala shodný počet bodů,“ vysvětluje David Strejc.

Zjednodušeně se dá říct tohle. Astra od OpenAI je lepší dělník. Umí sedět u počítače a klikat, otevřít program, vyplnit formulář, něco nakreslit. Je silnější v matematice a technických oborech. Claude je lepší přemýšlivec. Vede v úlohách, kde se musí dlouho uvažovat, a jeho práce jde podle testerů lépe zkontrolovat.

Ceny jsou na papíře stejné. Oba stojí zhruba 210 korun za milion tokenů na vstupu a 1 050 korun za milion tokenů na výstupu. Ve skutečnosti se ale liší docela dost, protože Astra je méně upovídaná. Podle Artificial Analysis dosahuje stejného skóre při asi čtyřiceti procentech nákladů na jeden úkol.

Pro firmu z toho plyne jediné praktické doporučení: netestujte podle recenzí, ale na vlastní agendě. Rozdíl mezi těmi dvěma programy se v běžném provozu projeví jinde než na žebříčcích.

Věta, které by si měl všimnout každý

Tohle je nejdůležitější informace z celého září a skoro nikdo ji nepřevzal.

OpenAI ve vlastním oznámení k novému modelu přiznala zhoršení. U Astry je hůř vidět, jak přemýšlí. Testovali to tak, že programu přímo zadali, ať se pokusí kontrole vyhnout, a dařilo se mu to lépe než předchozí verzi. Britský státní institut pro bezpečnost umělé inteligence došel k témuž. OpenAI uvedla, že další zvětšování modelu pozastaví, dokud si nebude jistá, že mu zase vidí do hlavy.

Firma tedy vydala nejsilnější program v dějinách a zároveň veřejně přiznala, že mu hůř rozumí. To není detail pro odborníky. To je informace o tom, v jaké fázi celé odvětví je.

„Nás se to netýká, máme vlastní systém“

„Tuhle větu slyším v českých firmách nejčastěji. A je to dnes ta nejnebezpečnější věta v celém rozhovoru,“ říká David Strejc.

Dosud platila bezpečnost skrz nezajímavost. Vaše skladová aplikace z roku 2017, kterou psali dva externisti a od té doby do ní nikdo nesáhl, byla v bezpečí z prostého ekonomického důvodu. Nikdo nebude tři týdny ručně rozebírat systém, ze kterého vytěží dvě stě tisíc korun.

Ta rovnice právě spadla.

Nový model OpenAI dokáže rozebrat hotový program bez zdrojového kódu a bez dokumentace a pochopit, jak funguje. Něco jako rozebrat motor bez servisní příručky. Zvládne to napoprvé v 88 procentech případů, zatímco předchozí verze v 56. Při testu na chybách z posledních tří měsíců sám objevil dvě díry, o kterých do té doby nikdo na světě nevěděl. Nezávislá laboratoř mu dala 226 bezpečnostních úloh, vyřešil jich 86, předchozí verze 34.

Je to první model OpenAI, který podle vlastní klasifikace firmy dosáhl nejvyššího stupně nebezpečnosti v oblasti počítačové bezpečnosti. Proto ta veřejná verze útočné úkoly odmítá.

A není to teorie. Google začátkem září popsal skutečný případ z letošního jara. Útočník použil běžného pomocníka na programování a jedno zadání. Za méně než šest hodin naplánoval, postavil a spustil kampaň, která ukradla tisíce cizích hesel. Program si sám hlídal, kde hledat díry, sám opravoval chyby za běhu a sám střídal adresy, aby ho nešlo vystopovat. Útočil přitom z počítačů napadené firmy, takže provoz vypadal legitimně. V jiném případě pak vyšetřovatelé našli na odhaleném serveru přehlednou nástěnku, která v reálném čase spravovala přes 23 800 ukradených přístupů.

Kde je namístě nepřehánět: Google výslovně uvádí, že zatím neviděl útok, který by proběhl úplně bez člověka. Pořád je to řemeslo, jen mnohonásobně rychlejší. Podle studie IBM vzrostly letos útoky s pomocí umělé inteligence o 56 procent, čtvrtina všech průniků už je takto asistovaná a jeden takový incident stojí firmu v průměru kolem 126 milionů korun, tedy asi o 21 milionů víc než běžný průnik.

Čína, Amerika a devatenáct dní tmy

Poslední souvislost, kterou by čeští podnikatelé měli znát, se netýká technologie, ale politiky.

Čínské modely jsou dnes od amerických špiček vzdálené jednotky procent, ale stojí zlomek. Ty nejlevnější vyjdou zhruba na tři až pět korun za milion tokenů, americké špičky na 210. Čína navíc dosud svoje modely rozdávala. Kdo chtěl, stáhl si je a provozoval doma na vlastním serveru. Americké laboratoře tohle letos neudělaly ani jednou.

V červenci ale Financial Times a Reuters napsaly, že čínské ministerstvo obchodu jedná s Alibabou, ByteDance a Zhipu o omezení přístupu cizinců k nejlepším čínským modelům. Obě velmoci tak nezávisle na sobě došly ke stejnému závěru. Tenhle software už nepovažují za zboží, ale za strategickou technologii.

Co to znamená v praxi, jsme viděli v červnu. Americké ministerstvo obchodu nařídilo firmě Anthropic zablokovat přístup cizincům a ta svoje nejlepší modely na devatenáct dní celosvětově vypnula. Varování přišlo tři dny předem.

Kdo na tom měl postavený provoz, měl smůlu. To je riziko, které v žádné technické dokumentaci nenajdete.

Bere nám to práci? Zatím ne. Ale zavírá dveře

Tady musím zabrzdit i sám sebe, protože nejjednodušší vyústění tohohle textu by znělo „umělá inteligence vám bere práci“. Data to zatím nepodpírají.

Ekonomové společnosti Anthropic zveřejnili v březnu studii, jejíž hlavní zjištění jde proti katastrofickému scénáři. Od spuštění ChatGPT není u lidí v ohrožených profesích měřitelný nárůst nezaměstnanosti. Newyorský Fed prověřoval pracovní inzeráty a došel k podobnému. Nábor se sice celkově zpomalil, ale zřetelný pokles způsobený umělou inteligencí v datech vidět není, a nůžky se navíc začaly rozevírat ještě před příchodem ChatGPT.

Jedno místo, kde ten efekt skutečně vidět je, ale existuje. U lidí ve věku dvaadvaceti až pětadvaceti let, kteří do těch profesí teprve vstupují, klesla šance najít práci zhruba o čtrnáct procent.

Nejde tedy o propouštění lidí v půlce kariéry. Jde o zavírání vstupních dveří, kterými se absolventi tradičně dostávali do kancelářské práce. Jsou to přesně ty úkoly, na kterých se junior učil řemeslo. Rešerše, první verze dokumentu, přepis, kontrola čísel. Firma je dnes zadá stroji, protože je to levnější a hotové do minuty. A za pět let zjistí, že nemá koho povýšit.

„Souhrnně bych to tedy formuloval takhle. Schopnost už tady je a dá se změřit. Mezi větou ,stroj to umí´ a větou ,naše firma to používá´ je ale pořád propast, do které většina firem zatím padá. A jediné místo, kde to statistika dneska vidí, jsou dveře pro mladé,“ upozorňuje David Strejc.

Co s tím dělat

Tři věci, které dávají smysl bez ohledu na to, jestli vám umělá inteligence přijde jako příležitost, nebo jako hrozba.

Udělejte si soupis, co vám vlastně kde běží. Zní to banálně, ale většina firem nemá seznam vlastních systémů, natož jejich zranitelností. Dvoufaktorové přihlášení všude, výměna starých přístupových klíčů, funkční zálohy. Nic z toho není nové. Nové je jen to, že spoléhání na „nás nikdo zkoumat nebude“ přestalo platit.

Testujte na vlastní agendě, ne podle recenzí. Žebříčky měří něco jiného než vaši fakturaci. Vyberte tři konkrétní úkoly, které ve firmě někdo dělá každý týden, a zkuste je zadat stroji. Odpověď dostanete za odpoledne a bude platit víc než jakýkoli článek. Včetně tohohle.

Sledujte, koho přestáváte nabírat. Pokud jste letos nevzali žádného juniora, protože „to stejně zvládne AI“, máte pravdu v krátkodobém horizontu a problém v pětiletém.

A jedna poznámka pro úplnost. Od srpna musí poskytovatelé podle evropského nařízení o umělé inteligenci označovat výstupy svých modelů strojově čitelně, ať už vodoznakem, metadaty nebo jinou technikou, a zajistit, aby šlo rozpoznat, že obsah vytvořila nebo upravila AI. Podle pokynů Evropské komise k tomu patří i zpřístupnění nástroje, kterým si původ obsahu může ověřit kdokoli, nejen úřady, výzkumníci a fact-checkeři. Ověřit si, jestli text psal člověk, tedy bude o něco snazší i pro vás.

Zdroje

Anthropic: Claude Fable 5.1, 1. 9. 2026. OpenAI: GPT-6 Astra, 3. 9. 2026 (Axios, Fortune, Al Jazeera, 3.–4. 9. 2026).

Zapier: AutomationBench, 657 úloh napříč financemi, HR, marketingem, provozem, obchodem a podporou (zapier.com/benchmarks).

Artificial Analysis: Intelligence Index v4.3 — Astra a Claude Fable 5.1 shodně 53 bodů; ceny 10 a 50 dolarů za milion tokenů.

OpenAI: GDPval — 1 320 úkolů, 44 povolání, 9 největších sektorů americké ekonomiky, autoři s průměrně 14 lety praxe, slepé párové hodnocení (openai.com/index/gdpval, arXiv:2510.04374).

Irregular: nezávislé testování FrontierCyber — 86 z 226 úloh proti 34 u předchozí verze.

Google Threat Intelligence Group: AI Threat Tracker, 8. 9. 2026 — kampaň postavená a spuštěná pod šest hodin ve druhém čtvrtletí 2026; v odděleném případě nástěnka s více než 23 800 přístupy.

IBM a Ponemon Institute: Cost of a Data Breach Report 2026, 29. 7. 2026 — nárůst útoků s AI o 56 procent, čtvrtina zlovolných průniků, průměr 6 milionů dolarů za incident, tedy asi milion nad běžným průnikem.

Reuters, 7. 7. 2026 a Financial Times, 21. 7. 2026: jednání čínského ministerstva obchodu s Alibabou, ByteDance a Zhipu (Z.ai) o omezení přístupu k pokročilým modelům.

Anthropic: pozastavení přístupu k modelům Fable 5 a Mythos 5 na příkaz amerického ministerstva obchodu, 12. 6. až 1. 7. 2026.

Anthropic Economic Index, březen 2026 a Federal Reserve Bank of New York: data o dopadu na zaměstnanost a nábor.

Nařízení EU o umělé inteligenci, článek 50 — transparentnostní povinnosti platné od 2. 8. 2026, včetně povinnosti označit výstupy strojově čitelně a zajistit jejich detekovatelnost. Pokyny Evropské komise k článku 50 tuto povinnost vykládají tak, že poskytovatel musí zpřístupnit detekční mechanismus fyzickým osobám, úřadům, výzkumníkům a fact-checkerům. Kodex chování k transparentnosti obsahu generovaného AI, který k tomu přidává bezplatnou a veřejnou dostupnost, je dobrovolný nástroj prokazování souladu. Pro systémy na trhu před 2. 8. 2026 platí přechodné období do 2. 12. 2026.

Máte na tohle téma jiný názor? Napište o něm vlastní článek.

Texty jsou tvořeny uživateli a nepodléhají procesu korektury. Pokud najdete chybu nebo nepřesnost, prosíme, pošlete nám ji na medium.chyby@firma.seznam.cz.

Sdílejte s lidmi své příběhy

Stačí mít účet na Seznamu a můžete začít publikovat svůj obsah. To nejlepší se může zobrazit i na hlavní stránce Seznam.cz

Doporučované

Načítám