Hlavní obsah

GPT, Claude, Gemini nebo něco jiného? Rozhoduje úloha, ne tabulka

Foto: Jiný Kontext

Veřejný žebříček je mapa jedné úlohy, jedné sady zadání a jednoho způsobu bodování. Není to rozsudek o tom, který model je nejlepší pro českou práci.

Článek

Veřejný žebříček je mapa jedné úlohy, jedné sady zadání a jednoho způsobu bodování. Není to rozsudek o tom, který model je nejlepší pro českou práci.

Otázka „která AI je nejlepší“ nemá jednu univerzální odpověď. Jeden model může být příjemnější v běžném chatu, jiný přesnější při programování, další levnější nebo lepší v češtině. Rozhoduje úloha, způsob měření, cena chyby a podmínky konkrétní služby.

Každý žebříček měří něco jiného

Chatovací arény nechávají uživatele vybrat lepší ze dvou anonymních odpovědí. Takové hodnocení zachycuje celkovou preferenci: tón, délku, přehlednost, ochotu odpovědět a jen někdy správnost. Plynulá odpověď s chybou tak může získat hlas proti přesnější, ale méně příjemné odpovědi.

Programátorské testy měří řešení konkrétních úloh v připravených repozitářích. Pomohou odhadnout schopnost opravovat kód, neměří ale automaticky architekturu, bezpečnostní kontrolu, práci v interním systému ani českou dokumentaci. Testy znalostí s výběrem odpovědi ověřují široký soubor otázek, neříkají však, jak model pracuje s dlouhým dokumentem, jak přizná nejistotu nebo zda nevymyslí zdroj.

Na protokolu záleží stejně jako na skóre

Dva výsledky nelze férově srovnat, pokud jeden vznikl při jediném pokusu a druhý jako nejlepší z několika běhů. Výsledek ovlivňuje i povolená délka přemýšlení, dostupné nástroje, testovací prostředí a to, zda skóre zveřejnil nezávislý hodnotitel, nebo sám výrobce.

Foto: Jiný Kontext

Vlastní test na reálných úlohách řekne víc než obecné skóre.

Při čtení tabulky si proto zaznamenejte přesný název testu, verzi, datum, počet pokusů a podmínky. Stejný název benchmarku, třeba u programátorských testů v různých variantách, ještě neznamená stejný experiment.

Anglické měření není české použití

Model, který dobře odpovídá anglicky, nemusí stejně dobře psát český právní rozbor, opravovat stylistiku nebo rozumět domácím institucím. České sady jsou důležité, mají ale také omezení: nemusí obsahovat nejnovější uzavřené modely a často měří jen několik typů úloh. Údaj „není v žebříčku“ proto neznamená „prohrál“, jen že model nebyl stejnou metodikou změřen.

Cena není jen sazba za token

Levnější model může vyjít dráž, pokud potřebuje víc pokusů, delší kontrolu nebo častěji vytvoří chybu, která projde dál. Do nákladů patří rychlost, integrace, ochrana dat, možnost exportu i práce lidí, kteří výstup ověřují. Nejdražší model zase nemusí být rozumný pro jednoduché třídění, kde stačí levnější nástroj s jasnou kontrolou.

Také odmítnutí odpovědi může být chybou i ochranou. U marketingového návrhu jen zdržuje, u právního, zdravotního nebo bezpečnostního rozhodnutí může zabránit škodě. Hodnotit ho je třeba podle konkrétní role.

Foto: Jiný Kontext

Kritéria výběru by měla odpovídat tomu, co a jak často kontrolujete.

Nejlepší je vlastní test

Sestavte malou sadu úloh, které skutečně děláte: český e-mail, shrnutí dokumentu, práci se zdroji, opravu kódu a úkol, u něhož záleží na bezpečnosti. Dva kandidáty spusťte ve stejný den, se stejným zadáním a srovnatelným nastavením. Hodnoťte faktickou správnost, vymyšlené citace, úplnost, cenu, dobu odpovědi a náročnost kontroly. U každé chyby se ptejte, zda by ji váš běžný proces zachytil.

Dobrá volba není model s největším jedním číslem. Je to model, jehož silné a slabé stránky odpovídají vaší práci a jehož chyby dokážete rozpoznat dřív, než způsobí škodu.

Zdroje

- Chiang, W.-L. a kol. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. ICML.

- Singh, S. a kol. (2025). The Leaderboard Illusion. arXiv:2504.20879.

- Jimenez, C. E. a kol. (2024). SWE-bench. ICLR.

- Hendrycks, D. a kol. (2021). Measuring Massive Multitask Language Understanding. ICLR.

- Fajcik, M. a kol. (2025). BenCzechMark. TACL.

Původně publikováno na jinykontext.cz: https://jinykontext.cz/clanek/jak-vybrat-ai-model

Máte na tohle téma jiný názor? Napište o něm vlastní článek.

Texty jsou tvořeny uživateli a nepodléhají procesu korektury. Pokud najdete chybu nebo nepřesnost, prosíme, pošlete nám ji na medium.chyby@firma.seznam.cz.

Související témata:

Sdílejte s lidmi své příběhy

Stačí mít účet na Seznamu a můžete začít publikovat svůj obsah. To nejlepší se může zobrazit i na hlavní stránce Seznam.cz