xAI kündigte am 18. September Grok Voice Transcribe 2.0 an. Die Schnittstelle unterstützt Aufnahmen und laufende Audioströme, die Unterscheidung von Sprechern sowie Zeitmarken.

Das Unternehmen meldet eine höhere Genauigkeit, doch seine Ergebnisse garantieren diese nicht für jede Aufnahme. Bei der redaktionellen Prüfung nannte die Dokumentation weiterhin 1.0 als Standard; die automatische Umstellung auf 2.0 ist laut Ankündigung erst geplant.

Mögliche Anwendungen sind Untertitel, durchsuchbare Interviews und Besprechungsnotizen. Vor dem Einsatz müssen Fehler bei den vorgesehenen Sprachen, Akzenten, Hintergrundgeräuschen und überlappenden Stimmen gemessen sowie Regeln für sensible Aufnahmen festgelegt werden.

Für einen kleinen Pilotversuch schätzen wir optimistisch 1–3 Monate. Ein breiterer Einsatz hängt von den Testergebnissen und den Kosten menschlicher Kontrolle ebenso ab wie von der Verfügbarkeit der API.