Článek
Na obrazovce je normální stránka: nadpis, odstavce, čísla, podpis. Zkusíte ale táhnout myší přes větu a nic. Ctrl+F nenajde ani slovo, které přitom vidíte přímo před sebou. Není to nutně rozbitý prohlížeč. PDF totiž může obsahovat stránku, kterou člověk čte jako text, zatímco počítač ji zná jen jako fotografii.
To je jedna z vlastností formátu PDF, která mate i zkušené uživatele. PDF neznamená „textový dokument“. Je to obal, do kterého lze uložit text, vektorovou grafiku, fotografie i celé naskenované stránky. Dva soubory proto mohou vypadat na první pohled totožně, ale uvnitř být úplně jiné.
Sken je v první chvíli opravdu jen obrázek
Když položíte papírovou stránku do skeneru a uložíte ji jako PDF bez dalšího zpracování, skener zachytí obraz. Písmeno A pro něj není písmeno A, ale určitá sestava světlých a tmavých pixelů. Adobe to ve své dokumentaci popisuje přímo: naskenované PDF může obsahovat pouze obrazová data, nikoli prohledávatelný text.
Proto nejde kliknout mezi dvě písmena, označit odstavec nebo vyhledat jméno. Program nemá co označovat. Vidí jeden velký obrázek stránky.
OCR přidá druhou, neviditelnou vrstvu
Právě tady nastupuje OCR – optické rozpoznávání znaků. Program analyzuje obraz, hledá tvary písmen, slov a řádků a pokusí se k nim přiřadit skutečné znaky. Výsledkem může být textová vrstva, která leží nad nebo pod původním obrazem stránky.
Čtenář pak stále vidí původní sken se všemi razítky, skvrnami a typografií, ale počítač už za ním „ví“, že na určitém místě stojí například slovo Praha. Najednou funguje Ctrl+F, kopírování i čtečka obrazovky.
Proto může kopírovaný text vypadat úplně jinak než stránka
OCR není kouzlo. Starý psací stroj, šikmý sken, nízké rozlišení, razítko přes text nebo nezvyklé písmo mohou rozpoznávání zmást. Na obrazovce vidíte správné slovo, protože koukáte na fotografii originálu, ale po zkopírování dostanete překlep. To je chyba skryté rozpoznané vrstvy, ne změna obrazu.
Adobe proto po OCR doporučuje rozpoznaný text zkontrolovat. Některé nástroje dokonce umějí označit slova, u nichž si systém nebyl jistý, aby je člověk ručně opravil.
Neoznačitelný text ale nemusí vždy znamenat sken
Praktická zkratka „nejde označit = je to obrázek“ funguje často, ne stoprocentně. Výběr nebo kopírování může omezovat zabezpečení PDF. Některé dokumenty zase obsahují text převedený na grafické křivky, takže písmena vypadají dokonale, ale už nejsou textovými znaky. A občas je problém jen v konkrétním prohlížeči.
Nejrychlejší test je proto jednoduchý: zkuste označit jednu větu a pak ji vyhledat. Pokud to nejde, podívejte se, zda prohlížeč nabízí OCR nebo rozpoznání textu. U naskenovaných archivních dokumentů je právě obrazová stránka bez textové vrstvy velmi častým vysvětlením.
Proč na tom vůbec záleží
Rozdíl není kosmetický. Prohledávatelné PDF se dá rychle procházet, kopírovat z něj údaje a lépe ho mohou využívat asistivní technologie. U stovek stran znamená OCR rozdíl mezi ručním listováním a několika sekundami hledání.
Až tedy příště otevřete PDF, které vypadá naprosto normálně, ale chová se jako zamčená fotografie, nemusí být soubor pokažený. Možná se jen díváte na papír, který byl před lety vyfotografován stránku po stránce – a nikdo mu zatím nevysvětlil, která skvrna na obrazu je písmeno.
Použité zdroje
Odkazy byly ověřeny při rešerši 7. 10. 2026. U časově citlivých údajů je před publikací vhodná finální kontrola.
[1] Adobe Acrobat Help: vysvětlení, že běžný sken obsahuje obrazová data a OCR vytváří prohledávatelnou textovou vrstvu — https://helpx.adobe.com/cz/acrobat/desktop/create-documents/scan-documents-to-pdfs/recognize-text.html
[2] Adobe Acrobat OCR: praktický popis OCR a rozpoznání, zda PDF pravděpodobně obsahuje naskenovaný text — https://www.adobe.com/cz/acrobat/online/ocr-pdf.html
[3] Adobe Acrobat Help: kontrola a oprava chyb rozpoznaného textu po OCR — https://helpx.adobe.com/acrobat/desktop/create-documents/scan-documents-to-pdfs/fix-scanned-text.html





