Hlavní obsah

Roboti mezi námi

Foto: GVKB CZ

Roboti mezi námi

Přimět tyto rozdílné světy, aby si bezchybně rozuměly, vyžaduje extrémně robustní platformy (Robot Operating System)

Článek

Jak naučit robota aby viděl stejně jako člověk a zvládl cestu ve městě plném turistů bez problémů?  Naučit robota vnímat svět a pohybovat se lidskýma očima v chaotickém prostředí, jako je historické centrum plné turistů, představuje v oblasti robotiky a umělé inteligence jednu z největších výzev. Abychom toho dosáhli, musíme kombinovat pokročilé snímání, zpracování obrazu a adaptivní plánování pohybu. Zde je přehled klíčových pilířů, jak toho moderní robotika dosahuje. Lidský mozek nezpracovává každý detail vědomě využívá periferní vidění, hloubkové vnímání a bleskovou predikci. Robot se k tomu přibližuje pomocí následujících technologií.

Stereo vidění a hloubkové kamery. Dvě kamery simulující lidské oči poskytují paralaxu, což robotovi umožňuje okamžitě odhadnout vzdálenost objektů (lidí, laviček, obrubníků) v prostoru. Sémantická segmentace: Neuronové sítě se učí rozlišovat, na co se dívají. Obraz nerozdělují jen na pixely, ale okamžitě identifikují: „Tohle je turista s batohem, tohle je sloup veřejného osvětlení a tohle je volný prostor k chůzi.“ Predikce záměrů: Stejně jako člověk podvědomě tuší, že se turista náhle zastaví, aby si vyfotil budovu, moderní modely sledují směr pohledu, natočení těla a rychlost chůze lidí kolem a předem počítají s jejich trajektorií.

Město plné turistů je extrémně dynamické překážky se neustále objevují a mizí. Tradiční metody (např. pevné mapy a vyhýbání se statickým stěnám) zde nestačí. Robot si v reálném čase vytváří 3D mapu okolí a zároveň určuje svou přesnou polohu. V prostředí bez stabilních GPS signálů (např. v úzkých uličkách mezi vysokými domy) spoléhá čistě na vizuální data a inerciální senzory (IMU). Reaktivní vyhýbání: Algoritmy pro pohyb v davu napodobují lidskou ohleduplnost. Robot nepoužívá jen brutální zastavení, ale plynule přizpůsobuje rychlost, kličkuje, „uhýbá pohledem“ a předvídá mezery v davu, kterými může proplout, aniž by lidi omezoval.

Protože v davu záleží na každé milisekundě, robot potřebuje obrovský výpočetní výkon, aby dokázal zpracovat desítky snímků za sekundu bez zpoždění. Člověk v davu intuitivně ví, že lidé se shlukují kolem zmrzlinářů nebo že turisté s mapami v rukou dělají nečekané úkoly. Budoucí roboti integrují multimodální modely, které chápou kontext místa, což jim pomáhá upravit agresivitu či opatrnost své jízdy. Podle mě by dvě kamery nestačili bylo by potřeba 6 kamer a k tomu i jiné systémy co vnímají realitu. Máte naprostou pravdu a vystihl jste to velmi přesně. Spoléhat se pouze na dvě kamery (klasické stereo vidění) by v hustém a chaotickém davu turistů nestačilo.

Lidské oči sice fungují skvěle, ale máme k nim obrovský „bonus“ krk, kterým můžeme bleskově otáčet, a mozek, který dokáže vnímat celistvý kontext a nečekané podněty ze všech stran. Robot v davu potřebuje mnohem komplexnější smyslovou výbavu. Panoramatický rozhled 360°: Šest kamer rozmístěných po obvodu robota eliminuje veškeré „mrtvé úhly“. Turisté se pohybují ze stran, předbíhají zezadu a děti nebo zvířata mohou být nízko u země. Slepá víra v samotný obraz by byla riskantní, protože kamery lze snadno oslepit.

Proto se kombinuje několik zcela odlišných technologií. Zatímco kamera vidí barvy a tvary, Lidar vysílá miliony laserových paprsků za sekundu a vytváří přesnou 3D „geometrickou“ mapu vzdáleností. Nevadí mu ostré světlo ani šero a spolehlivě odhalí i průhledné či tenké překážky, které kamera přehlédne. Ultrazvukové a radarové senzory. Podobně jako parkovací senzory v autě slouží v těsné blízkosti robota k okamžité detekci překážek na dotek nebo těsně u těla. Inerciální jednotky (IMU) a kolová orometrie: Sledují zrychlení, otřesy a náklon, což robotovi pomáhá udržet rovnováhu a vědět, kde přesně je, i když zrovna ztratí vizuální přehled (např. když ho na chvíli zcela zakryje hustý dav lidí).

Zatímco zpracování obrazu z 6 kamer a pokročilá AI vyžadují určitý (byť nepatrný) čas na výpočet, v krizové situaci když vám náhle někdo skočí do cesty robot potřebuje reflexy. Systémy proto fungují ve vrstvách: pomalejší, vysoce inteligentní vrstva plánuje trasu a rozpoznává lidi, ale nejnižší vrstva (reflexní) na základě přímých dat z Lidaru a ultrazvuku dokáže okamžitě zastavit nebo uhnout v řádu milisekund. Největší problém je spolupráce mezi programy. Mnoho lidí si myslí, že největší překážkou je hardware nebo samotná umělá inteligence, ale skutečným „zakopaným psem“ v moderní robotice je softwarová integrace a architektura.

Když se podíváte na to, co takový robot musí dělat současně, pochopíte, jak obří je to výzva. Kamera chrlí desítky velkých snímků za sekundu, Lidar sype milióny bodů v reálném čase, IMU senzory posílají data v řádu tisícin sekundy a plánovač trasy přemýšlí v delších cyklech. Sladit tyto různé „týpky s různým tempem“ je noční můra. Program pro zpracování obrazu ze 6 kamer potřebuje obrovskou šířku pásma, aby svá data poslal dál k vyhodnocení. Pokud se data „zaseknou“ v paměti nebo síti robota, má zpoždění, které v davu turistů znamená kolizi.

Rozmanité technologie a jazyky: Často se stává, že nízko úrovňové ovládání motorů je psané v C++ kvůli maximální rychlosti, AI modely pro rozpoznávání lidí běží v Pythonu a systém pro správu chování používá něco úplně jiného. Přimět tyto rozdílné světy, aby si bezchybně rozuměly, vyžaduje extrémně robustní platformy (Robot Operating System). Když se navíc jeden program „zadrhne“ nebo spadne kvůli nečekané chybě, celý systém se nesmí zhroutit, robot musí umět okamžitě přepnout do nouzového režimu.

Máte na tohle téma jiný názor? Napište o něm vlastní článek.

Texty jsou tvořeny uživateli a nepodléhají procesu korektury. Pokud najdete chybu nebo nepřesnost, prosíme, pošlete nám ji na medium.chyby@firma.seznam.cz.

Související témata:

Sdílejte s lidmi své příběhy

Stačí mít účet na Seznamu a můžete začít publikovat svůj obsah. To nejlepší se může zobrazit i na hlavní stránce Seznam.cz

Doporučované

Načítám