Microsoft 1. října uvedl MAI-Transcribe-2-Streaming a hlasové modely MAI-Voice-2.1 a Flash. Přepis přichází už během mluvení. Vercel samostatně dokumentuje jejich zpřístupnění v AI Gateway, nikoli nezávislé měření výkonu.

Možné využití: při diktování servisního požadavku by aplikace mohla průběžně nabídnout relevantní nápovědu. Výhodou by nebylo jen méně čekání, ale také možnost opravit nedorozumění dřív. Náš scénář však nepočítá s tím, že by neúplná věta směla sama objednat zboží nebo změnit rezervaci.

Co je potřeba zvládnout: průběžná hypotéza přepisu se může změnit. Rozhraní má proto oddělit rozpracovaný text od potvrzeného záznamu a nevratnou akci vyžádat k odsouhlasení. Rychlost samotného modelu není celková odezva hovoru: vstupují do ní síť, určení konce řeči, rozhodování i přehrávání. Dostupnost přes službu také neznamená provoz bez odeslání zvuku mimo zařízení.

Optimistický horizont: u existující aplikace odhadujeme 2–4 týdny na omezený pilot s vlastními nahrávkami, místními názvy a rušivými zvuky. Češtinu ani klonování hlasu jsme netestovali; jazykovou podporu a souhlas nositele hlasu je nutné ověřit před nasazením. Jde o náš odhad, ne termín spolehlivého autonomního telefonisty.