Il 1° ottobre Microsoft ha pubblicato MAI-Transcribe-2-Streaming e i modelli vocali MAI-Voice-2.1 e Flash. Il testo arriva mentre si parla. Vercel documenta separatamente l'accesso tramite AI Gateway, non misure indipendenti delle prestazioni.
Possibile utilizzo: mentre una persona detta una richiesta di assistenza, un'applicazione potrebbe mostrare progressivamente suggerimenti pertinenti. Il vantaggio sarebbe meno attesa e la possibilità di correggere presto i malintesi. Il nostro scenario non permette però a una frase incompleta di ordinare prodotti o modificare da sola una prenotazione.
Che cosa bisogna risolvere: un'ipotesi di trascrizione provvisoria può cambiare. L'interfaccia dovrebbe distinguere il testo in lavorazione dal verbale confermato e chiedere l'approvazione per azioni irreversibili. La velocità del modello non è il tempo totale di risposta: contano rete, rilevamento della fine del parlato, ragionamento e riproduzione. L'accesso al servizio non significa che l'audio resti sul dispositivo.
Orizzonte ottimistico: per un'applicazione esistente stimiamo 2–4 settimane per un progetto pilota limitato con registrazioni proprie, nomi locali e rumori di fondo. Non abbiamo testato il ceco né la clonazione vocale; supporto linguistico e consenso della persona devono essere verificati prima dell'uso. È una nostra stima, non la data di un centralinista autonomo affidabile.
Apri la discussione con il primo commento.