Článek
Veřejný žebříček je mapa jedné úlohy, jedné sady zadání a jednoho způsobu bodování. Není to rozsudek o tom, který model je nejlepší pro českou práci.
Otázka „která AI je nejlepší“ nemá jednu univerzální odpověď. Jeden model může být příjemnější v běžném chatu, jiný přesnější při programování, další levnější nebo lepší v češtině. Rozhoduje úloha, způsob měření, cena chyby a podmínky konkrétní služby.
Každý žebříček měří něco jiného
Chatovací arény nechávají uživatele vybrat lepší ze dvou anonymních odpovědí. Takové hodnocení zachycuje celkovou preferenci: tón, délku, přehlednost, ochotu odpovědět a jen někdy správnost. Plynulá odpověď s chybou tak může získat hlas proti přesnější, ale méně příjemné odpovědi.
Programátorské testy měří řešení konkrétních úloh v připravených repozitářích. Pomohou odhadnout schopnost opravovat kód, neměří ale automaticky architekturu, bezpečnostní kontrolu, práci v interním systému ani českou dokumentaci. Testy znalostí s výběrem odpovědi ověřují široký soubor otázek, neříkají však, jak model pracuje s dlouhým dokumentem, jak přizná nejistotu nebo zda nevymyslí zdroj.
Na protokolu záleží stejně jako na skóre
Dva výsledky nelze férově srovnat, pokud jeden vznikl při jediném pokusu a druhý jako nejlepší z několika běhů. Výsledek ovlivňuje i povolená délka přemýšlení, dostupné nástroje, testovací prostředí a to, zda skóre zveřejnil nezávislý hodnotitel, nebo sám výrobce.

Vlastní test na reálných úlohách řekne víc než obecné skóre.
Při čtení tabulky si proto zaznamenejte přesný název testu, verzi, datum, počet pokusů a podmínky. Stejný název benchmarku, třeba u programátorských testů v různých variantách, ještě neznamená stejný experiment.
Anglické měření není české použití
Model, který dobře odpovídá anglicky, nemusí stejně dobře psát český právní rozbor, opravovat stylistiku nebo rozumět domácím institucím. České sady jsou důležité, mají ale také omezení: nemusí obsahovat nejnovější uzavřené modely a často měří jen několik typů úloh. Údaj „není v žebříčku“ proto neznamená „prohrál“, jen že model nebyl stejnou metodikou změřen.
Cena není jen sazba za token
Levnější model může vyjít dráž, pokud potřebuje víc pokusů, delší kontrolu nebo častěji vytvoří chybu, která projde dál. Do nákladů patří rychlost, integrace, ochrana dat, možnost exportu i práce lidí, kteří výstup ověřují. Nejdražší model zase nemusí být rozumný pro jednoduché třídění, kde stačí levnější nástroj s jasnou kontrolou.
Také odmítnutí odpovědi může být chybou i ochranou. U marketingového návrhu jen zdržuje, u právního, zdravotního nebo bezpečnostního rozhodnutí může zabránit škodě. Hodnotit ho je třeba podle konkrétní role.

Kritéria výběru by měla odpovídat tomu, co a jak často kontrolujete.
Nejlepší je vlastní test
Sestavte malou sadu úloh, které skutečně děláte: český e-mail, shrnutí dokumentu, práci se zdroji, opravu kódu a úkol, u něhož záleží na bezpečnosti. Dva kandidáty spusťte ve stejný den, se stejným zadáním a srovnatelným nastavením. Hodnoťte faktickou správnost, vymyšlené citace, úplnost, cenu, dobu odpovědi a náročnost kontroly. U každé chyby se ptejte, zda by ji váš běžný proces zachytil.
Dobrá volba není model s největším jedním číslem. Je to model, jehož silné a slabé stránky odpovídají vaší práci a jehož chyby dokážete rozpoznat dřív, než způsobí škodu.
Zdroje
- Chiang, W.-L. a kol. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. ICML.
- Singh, S. a kol. (2025). The Leaderboard Illusion. arXiv:2504.20879.
- Jimenez, C. E. a kol. (2024). SWE-bench. ICLR.
- Hendrycks, D. a kol. (2021). Measuring Massive Multitask Language Understanding. ICLR.
- Fajcik, M. a kol. (2025). BenCzechMark. TACL.
Původně publikováno na jinykontext.cz: https://jinykontext.cz/clanek/jak-vybrat-ai-model





