Článek
Statistické skóre není původ. Vodoznak (watermark) není detektor libovolného výstupu chatbotu. Nízká míra falešných poplachů v laboratoři neplatí automaticky u nerodilého pisatele. A kontrola shody s prameny v Turnitinu není totéž co jeho skóre AI psaní.
Škola, dodavatel a laboratoř měří různé věci
Dodavatel měří označení podle svého modelu a prahu. Laboratoř měří výkon na určité sadě textů, v určitém jazyce a vůči určitým útokům. Univerzita rozhoduje, zda smí číslo vstoupit do trestu konkrétního člověka. Univerzita Karlova uvádí, že technicky spolehlivý způsob odhalení generativní AI neexistuje, a ČVUT zakazuje používat AI nástroje k detekci studentských prací kvůli falešně pozitivním i negativním výsledkům.
Jedno skóre má několik vrstev: signál (statistika textu, klasifikátor, vodoznak), práh, populaci textů, úpravy textu a rozhodnutí. Skóre je podnět, ne důkaz.
Podobnost není původ
Klasifikátor neviděl člověka u klávesnice. Neví, zda student napsal první verzi, použil model k osnově, nechal si opravit angličtinu, nebo převzal hotový výstup. Most mezi statistikou a původem tvoří znalost procesu, průběžné verze, konzultace a obhajoba.
Vodoznak funguje jen tehdy, když ho generátor používal, detektor zná konfiguraci a text neprošel změnou, která stopu rozbije. Laboratorní studie popisují detekci už z 25 tokenů; k září 2026 ale nelze tvrdit, že hlavní chatovací služby dávají běžnému uživateli ověřitelný textový vodoznak.
Falešné poplachy u nerodilých pisatelů
Studie Lianga a kolegů z roku 2023 testovala 91 esejí, které lidé psali anglicky jako cizím jazykem v testu TOEFL. U esejí amerických osmáků byly tytéž detektory téměř bezchybné. Sedm detektorů je průměrně chybně označilo v 61,22 % případů a alespoň jeden detektor označil 97,8 % esejí. Omezenější slovník a jednodušší věty mohou vypadat „strojově“; trestat takový signál znamená trestat styl nebo jazykové zázemí.
Shoda s prameny měří, zda se text shoduje s jiným textem, skóre AI psaní odhaduje, zda vypadá strojově. Míchat obojí v jednom trestu je chyba objektu.
Parafráze a změna nastavení
Benchmark RAID s více než 6 miliony vygenerovaných textů ukázal, že změna nastavení generování snižuje přesnost detektorů až o 32 procentních bodů. Podle Sadasivana a kolegů klesla přesnost detektoru po parafrázi z 97 na 80 % a úspěšnost metody DetectGPT spadla z 96,5 na 59,8 %, tedy blízko náhodě. Statistický signál lze změnit bez změny historického původu.

Průběžné verze a poznámky dokumentují proces psaní.
Fakulta humanitních studií UK i ČVUT proto pracují s prohlášením o využití AI. To netvrdí, že umíme každé použití zpětně rozpoznat; autor má popsat svou práci a nést za ni odpovědnost.
Anglická čísla nepatří na české práce
Čeština má jiné skloňování, slovosled i školní styl. Čísla detektoru trénovaného hlavně na angličtině nelze přenést na českou seminárku a žádný pramen neuvádí spolehlivou míru falešných poplachů pro české vysokoškolské práce.
Software vrátí číslo za sekundu, důsledky pak instituce i student nesou týdny. Otázka nezní, jak poznat AI text jedním číslem, ale čemu ze statistiky smíte věřit, u jaké populace a jakou chybu u tohoto člověka unesete.
Zdroje
- Liang, W. a kol. (2023). GPT detectors are biased against non-native English writers. Patterns.
- Sadasivan, V. S. a kol. Can AI-Generated Text be Reliably Detected? arXiv:2303.11156.
- Dugan, L. a kol. (2024). RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors. ACL.
- Kirchenbauer, J. a kol. (2023). A Watermark for Large Language Models. ICML.
- ČVUT. Rámcová pravidla používání umělé inteligence (2023); UK. Doporučení o generativní AI.
Původně publikováno na jinykontext.cz: https://jinykontext.cz/clanek/detekce-ai-textu





