Hlavní obsah

Nejlepší AI je ta, jejíž chybu ještě unesete

Foto: Jiný Kontext

Na poradě někdo promítne tabulku. ChatGPT, Claude, Gemini, Copilot, Perplexity, Grok, Mistral.

Článek

Na poradě někdo promítne tabulku. ChatGPT, Claude, Gemini, Copilot, Perplexity, Grok, Mistral. U každého jedno číslo a u jednoho jména zelená šipka. Vypadá to jako rozsudek. Ve vedlejší kanceláři mezitím právník najde v podání citaci, která neexistuje. A copywriter vedle toho škrtá překlep ve sloganu.

Všichni tři řeknou totéž slovo. Chyba. Cena je jiná. Překlep ve sloganu se opraví za minutu. Smyšlená citace v podání může stát důvěru i řízení. Odeslaná zpráva klientovi se někdy nevrátí vůbec.

Otázka „kterou AI vybrat“ zní jednoduše jen do chvíle, než si uvědomíme, že nesrovnáváme jednu věc. Model může být výborný a hotový produkt nevhodný. Citace může být pravá a závěr chybný. Dlouhý kontext může pojmout celý dokument a přesto přehlédnout odstavec, na kterém záleží. Nejlevnější předplatné se může prodražit časem kontroly.

„Nejlepší AI“ není vlastnost jako hmotnost. Je to zkratka pro balík požadavků. Kvalita textu, práce se zdroji, rychlost, cena, opakovatelnost, konektory, oprávnění, export, soukromí a následky omylu.

Žebříček odpovídá na jinou otázku

Vedení firmy často chce univerzální chat. IT oddělení chce napojení na e-mail, dokumenty a firemní identitu. Vývojář chce agenta, který čte repozitář a spouští testy. Analytik chce rešerši se zdroji. Bezpečnostní manažer chce vědět, co odchází ven, kdo to schvaluje a jestli z toho zbude audit.

Všichni mohou mít částečně pravdu. Každý srovnává jinou část systému. Když organizace koupí jednu licenci podle vítěze internetového žebříčku, může odpovědět na otázku, kterou si ve skutečnosti nikdo nepoložil.

Veřejné testy nejsou zbytečné. Nahrazují část dojmů opakovatelnou zkouškou. Jedno skóre ale není celá schopnost. V každém testu je schované rozhodnutí. Kdo vybral úlohy. V jakém jazyce. S jakými nástroji. Kolika pokusy. S jakým časovým limitem. Jestli se boduje přesný text, nebo funkční výstup.

Přesné procento může přesně měřit vadnou podmínku. Když jsou zadání neúplná nebo testy příliš úzké, číslo pořád vypadá jistě. Audit stovek programátorských úloh u jednoho známého benchmarku ukázal právě tohle metodické omezení. Skóre není rozsudek nad vaší prací.

Foto: Jiný Kontext

02-146-cesta-v-mlze.jpg

Model není totéž co produkt

Jedna odpověď má nejméně šest vrstev. Základní model, tedy jazykové schopnosti, znalosti a typické limity. Režim výpočtu, tedy rychlá odpověď, nebo delší uvažování s jiným limitem času. Pracovní aparát: systémové instrukce, plánování, paměť, kontrolní smyčka, práce se soubory. Zdroje a nástroje: web, databáze, kód, kalkulačka, konektory, interní dokumenty. Oprávnění: co smí přečíst, vytvořit, změnit, odeslat nebo smazat. A správa: co se ukládá, kdo to vidí, jak se schvaluje a jestli se dá vrátit krok zpět.

Dva produkty se stejným základním modelem proto nemusí odpovědět stejně. Aplikace může před dotaz vložit vlastní instrukce, připojit historii, vyhledat dokumenty nebo výsledek zkrátit. Programátorský agent může návrh ověřit testem. Běžný chat jen vytiskne kód.

Věta „AI se spletla“ je začátek diagnózy, ne její konec. Selhat mohl model. Mohl selhat výběr zdroje, připojený dokument, nástroj, oprávnění nebo kontrolní krok, který v produktu vůbec není.

Dlouhé okno kontextu na tom nic nemění. Studie o využití informací v dlouhém textu ukázala, že model může mít dokument celý a přesto hůř najít to, co leží uprostřed. „Vejde se to tam“ není totéž co „použije to, na čem záleží“.

Nejlepší je systém, jehož chybu unesete

Lidé obvykle hledají nástroj s nejvyšší šancí na správnou odpověď. Stejně důležité je, jak chyba vypadá. Jestli je vidět. Kolik stojí oprava. Jestli se výsledek dá vrátit.

Překlep v návrhu sloganu je levná chyba. Smyšlená citace v právním podání je drahá. Špatně pojmenovaný soubor se přejmenuje. Odeslaná zpráva klientovi nebo změna ve výrobním systému už někdy ne.

Riziko neroste jen s počtem omylů. Roste i tehdy, když systém podá chybný obsah velmi přesvědčivě. Profesionální tón svádí k důvěře, kterou obsah neunese. Profil NIST pro generativní systémy proto bere konfabulaci vážně. Ne jako raritu, ale jako známý typ selhání.

Schopnost je jen jedna osa. Další jsou pozorovatelnost chyby, vratnost výsledku a dopad selhání. Produkt s o něco slabším modelem, ale s jasnou historií zdrojů, omezenými oprávněními a schvalováním, může být pro organizaci bezpečnější než vítěz veřejného testu bez těchto opor.

Foto: Jiný Kontext

01-129-ai-v-medicine.jpg

Srovnávejte ekosystém, ne logo

Kolem modelu si každý produkt staví jiné prostředí. Někde je široký stůl pro text, analýzu, obrázky a kód. Jinde je výhoda v kancelářských aplikacích, ve vyhledávání, v repozitáři, nebo v tom, že model může běžet ve vlastní infrastruktuře.

Nejde jen o to, co systém umí dnes. Organizace potřebuje vědět, jak vyexportuje data a zadání. Jestli může vyměnit model. Jak se spravují oprávnění. Co se ukládá a jestli se to použije k dalšímu trénování. A jestli existuje postup pro den, kdy AI nepoběží.

Integrace umí ušetřit hodiny. Umí taky vytvořit závislost na jednom dodavateli a na jeho budoucích pravidlech. Otevřené váhy modelu ještě nejsou otevřený systém. Definice open source u AI žádá víc než soubor ke stažení.

Když nástroj čte interní data, vybírá zdroje nebo připravuje rozhodnutí, vstupuje do hry i právo. Povinnosti nasazujícího u vysoce rizikových systémů a pravidla transparentnosti nejsou marketingový dodatek. Jsou součástí ceny, i když se na faktuře neobjeví.

Pilot má měřit celý řetězec

Pro nákup je často cennější malý vnitřní test než celkové pořadí. Deset až třicet skutečných úloh, které smíte bezpečně použít. V češtině. S vašimi dokumenty. Se stejnými podmínkami pro dva nebo tři kandidáty. Třicet vlastních zadání může říct víc než tisíc otázek z oborů, které tým nikdy neotevře.

Zapisujte víc než dojem z první odpovědi. Čas do přijatelného výsledku. Počet oprav. Čas lidské kontroly. Typ chyby. Jestli jde doložit zdroj. Jestli se akce dá vrátit. Cenu jednoho přijatého výstupu.

Levný systém, který žádá trojnásobek kontroly, může být celkově dražší než dražší systém s menším počtem skrytých chyb. U kreativního návrhu může být naopak hromada nepoužitých variant v pořádku. Člověk pozná, kterou vzít.

Nejlepší systém není ten, který nikdy nechybuje. Takový dnes nemáme. Není to ani systém s nejvyšším skóre, nejdelším kontextem nebo největším počtem citací. Je to systém, jehož schopnosti sedí na skutečnou práci a jehož chyby jsou viditelné, vratné a snesitelné. Ekonomicky i lidsky.

Ve chvíli, kdy AI čte interní data, vybírá zdroje, mění soubory nebo připravuje rozhodnutí, nevybíráte jen pomocníka. Vybíráte i novou strukturu odpovědnosti. Správná otázka proto zní jinak. Kterou chybu uvidíme včas, kdo ji může vrátit a kdo ponese její cenu?

Zdroje

- NIST (2024). AI 600-1: Generative AI Profile. Konfabulace a rizika generativních systémů.

- Stanford CRFM (2022). Holistic Evaluation of Language Models. Hodnocení modelů je vícerozměrné a neúplné.

- Liu a kol. Lost in the Middle. Využití informací v dlouhém kontextu.

- Open Source Initiative. Open Source AI Definition 1.0. Rozdíl otevřeného systému a samotných vah.

- Evropská komise. Pokyny k povinnostem transparentnosti a článek 26 aktu o AI pro nasazující subjekty.

Původně publikováno na jinykontext.cz: https://jinykontext.cz/clanek/komu-dovolite-chybovat

Máte na tohle téma jiný názor? Napište o něm vlastní článek.

Texty jsou tvořeny uživateli a nepodléhají procesu korektury. Pokud najdete chybu nebo nepřesnost, prosíme, pošlete nám ji na medium.chyby@firma.seznam.cz.

Související témata:

Sdílejte s lidmi své příběhy

Stačí mít účet na Seznamu a můžete začít publikovat svůj obsah. To nejlepší se může zobrazit i na hlavní stránce Seznam.cz