Hlavní obsah
Internet, technologie a elektronika

Digitální věštírna 3/3: Když hlasový AI asistent pláče

Foto: Jindřich Bíža, vytvořeno pomocí AI Nano Banana

Převést text umělé inteligence, třeba odpověď na vaši otázku, který je plný „emocí“ do mluveného slova, aby to neznělo jako navigace v autě z roku 2005, je top high technologická disciplína.

Článek

Když AI mluví a mění tón hlasu, nejsou v tom skutečné city, ale pokročilá akustická matematika. Na začátku se AI neučí slova, ale zvuky. Inženýři nahrají profesionální herce, kteří čtou tisíce hodin textů s různým citovým zabarvením (od šepotu po vztek).

Počítač tyto nahrávky nerozdělí na písmena, ale převede je na takzvané spektrogramy – což jsou vizuální mapy zvukových frekvencí, hlasitosti a času. AI pak studuje, jak se fyzikálně mění lidský hlas, když člověk prožívá různé emoce:

  • Smutek: Frekvence hlasu klesá, tempo se zpomaluje, pauzy mezi slovy se prodlužují a tón je „plošší“.
  • Nadšení: Frekvence (výška hlasu) divoce skáče nahoru a dolů, tempo se zrychluje a roste intenzita (hlasitost).

Když tedy AI položíte otázku, ta vygeneruje textovou odpověď, která projde nejprve analýzou kontextu. Speciální neuronová síť (akustický model) se podívá na text a řekne: „Aha, tady je slovo ‚bohužel‘, věta končí otazníkem a celkový podtext je omluvný.“

Tento model pak matematicky předpoví, jak by měl vypadat výsledný zvukový spektrogram. Doslova vypočítá, jaké frekvence a délky hlásek lidé v takovém kontextu statisticky nejčastěji používají.

Posledním krokem je vocoder (neuronový syntezátor zvuku). Ten vezme vypočítaný matematický model spektrogramu a přemění ho na skutečné zvukové vlny, které slyšíte z reproduktoru. Moderní vocodery jsou tak dokonalé, že už negenerují jen samotná slova, ale dokáží do audio stopy přimíchat i mikroskopické detaily, které dělají lidský hlas lidským:

  • Mikropauzy na nadechnutí (podle délky věty).
  • Polykaní a chvění hlasivek (podle míry „stresu“ v textu).
  • Melodii vět (intonaci), aby konec věty přirozeně klesl nebo stoupl.

Když dnes slyšíte pokročilé hlasové asistenty, tito boti emoce nezažívají. Pouze v reálném čase počítají, kolik milisekund má trvat nádech a o kolik hertzů se má zvýšit tón hlasu, aby to na lidské ucho působilo naprosto přirozeně. Zatímco u psaného textu AI simuluje lidskou stylistiku, u hlasu simuluje lidskou biologii a akustiku. Obojí je ale stále ta stejná, neuvěřitelně rychlá statistická hra s pravděpodobností.

Může vás zajímat:

Zdroje:

https://www.capcut.com/cs-cz/resource/ai-voice-generator-with-emotion

Máte na tohle téma jiný názor? Napište o něm vlastní článek.

Texty jsou tvořeny uživateli a nepodléhají procesu korektury. Pokud najdete chybu nebo nepřesnost, prosíme, pošlete nám ji na medium.chyby@firma.seznam.cz.

Sdílejte s lidmi své příběhy

Stačí mít účet na Seznamu a můžete začít publikovat svůj obsah. To nejlepší se může zobrazit i na hlavní stránce Seznam.cz