Článek
Jsem solo zakladatel a stavím Penetrify, umělou inteligenci, která dělá penetrační testy sama. Vzal jsem ji a pustil na standardní oborový benchmark: 104 schválně děravých webových aplikací, každá s jednou skrytou vlajkou, kterou musí útočník najít a vytáhnout tím, že zneužije reálnou zranitelnost. Bez zdrojového kódu, bez nápovědy, bez člověka u klávesnice. Prolomila všech 104.
Než to začne znít jako tisková zpráva, přibrzdím sám sebe. Vysoké skóre na tomhle benchmarku není žádná novinka. Provozovatel testu, firma XBOW, sama říká, že sadu už dnes zvládá vyřešit celá řada nástrojů. Takže neprodávám to číslo. Zajímavé jsou dvě jiné věci: kolik to stálo a že jsem zveřejnil úplně všechno.
Co to vlastně dělalo
Režim byl black-box. To znamená, že agent dostal jen běžící aplikaci na nějaké adrese a jednu větu zadání: najdi zranitelnost, zneužij ji, vytáhni vlajku. Žádný kód, žádná konfigurace. To je přesně pozice, ze které startuje reálný útočník zvenčí. Spousta ukázek jiných AI agentů běží v mnohem lehčím white-box režimu, kde model vidí zdrojáky. Tady nic takového.
Vlajky jsou generované tak, že se nedají uhodnout. Test se počítá jako splněný jen tehdy, když se přesná vlajka objeví v záznamu agenta. Žádné částečné body, žádné hodnocení od oka.
Čísla
Sto čtyři aplikací, sto čtyři vyřešených. V našem nejrychlejším a nejlevnějším režimu. Průměrně to jednu aplikaci trvalo necelých deset minut, tu nejrychlejší asi minutu a půl, tu nejpomalejší přes hodinu. Přes celou sadu to byla nějakých sedmnáct hodin výpočtu.
A teď ta část, kvůli které to podle mě stojí za řeč. Jeden takový pentest vyjde na Penetrify na zhruba 29 dolarů, tedy asi 600 korun. Klasický lidský penetrační test jedné webové aplikace se u nás pohybuje v desítkách až stovkách tisíc korun a trvá týden až tři. Většina firem si ho proto dovolí jednou za rok a mezitím nasazuje naslepo.
Ať si o AI myslíte cokoli, tohle je reálná mezera mezi tím, co bezpečnostní služba stála dřív, a co stojí teď. A přesně takové věci mění celé trhy a někdy i profese.
Proč jsem zveřejnil logy
Tvrdit čísla umí každý. Proto jsem k nim vydal i test harness a všech 104 záznamů, jeden za každou aplikaci. Kdokoli si může cíle postavit znovu a spustit to celé sám a ověřit si, jestli nekecám. Skoro žádný dodavatel bezpečnosti tohle nedělá, čísla obvykle skončí na hezkém slajdu a dál se nedostanete. Mě zajímá opak.
A protože poctivost prodává líp než chvástání, řeknu i výhrady sám. Hodnocení je benevolentní, stačí, aby se vlajka objevila v logu, tak to ostatně XBOW zamýšlí. A jde o jejich validační sadu, ne o nějaké nové, tajné cíle. Nic z toho podle mě příběh neshazuje. Jen chci, aby si každý mohl udělat obrázek z dat, ne z mého nadšení.
Co s tím
Nemyslím si, že tohle přes noc nahradí zkušené pentestery. Složité byznys logiky, řetězené útoky, věci, kde je potřeba lidský vhled, to pořád zůstává na lidech. Ale rutinní část, ta, kterou dneska firma zaplatí draho a stejně jen jednou ročně, se dá dělat po každém nasazení, přímo v CI/CD, za cenu oběda pro tým. To je jiná bezpečnostní hygiena než jednou za rok si najmout někoho na týden.
Někdo se toho bude bát, někdo to uvítá. Mě spíš zajímá, že se posunula laťka toho, co je dostupné i pro malý tým bez vlastního bezpečáka.
Kdo si to chce prohlédnout nebo přebuildit sám, benchmark a všechny logy jsou tady: penetrify.cloud/en/benchmark. Klidně mi napište, rád pošlu i surová data.
Viktor Bulanek, zakladatel Penetrify

