Článek
Když se Jiřího Bernovského zeptáte, co dnes zvládne jazykový model puštěný doma, nezačne u modelu. Začne u paměti. Šestnáct gigabajtů na grafické kartě je podle něj minimum, čtyřiadvacet ideál, dvaatřicet už komfort. A pak přidá číslo, které si zapamatujete: dvě grafické karty v jeho počítači si v klidu berou 230 wattů, při plné zátěži 1 600. V létě se v jeho pracovně nedalo vydržet, dokud nezapnul klimatizaci, protože sestava dokázala vytopit místnost o dva až tři stupně nad venkovní teplotu.
Tohle v přehledech modelů nenajdete.
Zajímavé je, jak rychle se celý obor hýbe. Kimi 3, největší otevřený model, který je teď k dispozici, má 2,8 bilionu parametrů a šlape na paty modelům, které byly před půl rokem špičkou uzavřených laboratoří. Jirka se k němu dostal mezi prvními. Zaregistroval se, zaplatil a o pár hodin později si na X přečetl, že laboratoř omezuje registrace, protože nemá dost výpočetního výkonu, aby nápor utáhla. Vyprodáno. Ne kvůli ceně, kvůli železu.
Tady se otevírá otázka, u které jsme se zdrželi dlouho: dávají sankce vůbec smysl, když Čína modely vyvine, pustí je ven jako open weight a Silicon Valley na tom pak ušetří? Jirka připomíná, že sankce fungují jen do určité míry. Grafické karty se do Číny pašují přes třetí země stejně jako cokoli jiného. A DeepSeek už podle všeho běží na čipech od Huawei, takže NVIDIA přestává být úzkým hrdlem.
Mimochodem, nejvíc mě z celého dílu překvapila věc, která s modely přímo nesouvisí. Provozovatel jednoho většího webu si spočítal, kdo mu stahuje obsah. Anthropic a OpenAI dohromady 400 až 600 návštěv denně. Microsoft 7 000. Organická data, která vytvořili lidé, podle Jirky prakticky došla a modely se čím dál víc trénují na tom, co vygenerovaly jiné modely.
Praktická část rozhovoru je jednodušší, než jsem čekal. Malý model použijete tam, kde je postup jasně daný a není potřeba velké rozhodování: extrakce dat, převod hlasu na text, třídění. Jirka si takhle nechal protřídit fotky modelem, který se vejde do čtyř gigabajtů, a sám přiznal, že ho výsledek překvapil. Velký model nasadíte tam, kde je potřeba uvažovat. A mezi tím je celá škála, kterou dnes otevírá kvantizace. To je snížení přesnosti čísel, díky kterému se model, který měl padesát pět gigabajtů, vejde do dvaceti.
Nejlepší historky ale byly úplně jinde. V Číně je kavárna AGI Coffee, která vám místo wi-fi nabízí přístup k vlastnímu modelu. Dokud u nich něco konzumujete, můžete na jejich endpoint napojit svoje aplikace. Propojovací kabel mezi dvěma vývojářskými stroji stojí šest tisíc korun za půl metru. A když si Jirka stáhl nejnovější čínský model a ze zvědavosti se zeptal, komu se v Číně říká medvídek Pú, model mu normálně odpověděl. I s vysvětlením, že jde o hanlivou přezdívku, která je v Číně zakázaná.
Co si z toho odnáším: vstupní bariéra spadla mnohem níž, než jsem si myslel. Nepotřebujete stroj za čtvrt milionu. Stačí grafická karta, kterou možná už máte, a jedno odpoledne na to, abyste si přečetli, jak se to spouští. Jirka doporučuje jako první krok llama.cpp a jako druhý Hermes Agent.
A pak je tu věc, kterou jsem nečekal. Když má Jirka model doma, může se ho zeptat na cokoli. A taky to udělal. Řekl mu, ať zkusí hacknout jeho vlastní domácí síť. Model začal zkoušet hesla hrubou silou a skenovat, co v síti najde. Fascinující a nepříjemné zároveň.






