Ein Sprachassistent kann überzeugend klingen und trotzdem einen Namen oder eine Zahl falsch aussprechen. Das am 30. September auf Hugging Face angekündigte Open TTS Leaderboard bietet Messungen von Transkriptionsfehlern, Geschwindigkeit und Stimmähnlichkeit. Dazu kommen vergleichbare Hörbeispiele. Eine einzige Gesamtnote für Qualität ist es nicht.

Transkriptionsfehler zeigen die Übereinstimmung mit der Vorlage, nicht Natürlichkeit oder Ausdruck. Englische Ergebnisse lassen sich nicht auf Tschechisch oder Italienisch übertragen. Die veröffentlichte Methodik bindet Geschwindigkeitsmessungen zudem an bestimmte Hardware; daraus folgt keine Vorhersage für ein Smartphone im Mobilfunknetz. Bei der Ankündigung stand die Veröffentlichung der Auswertungsskripte noch aus.

Mögliche Nutzung: Wer einen gesprochenen Reiseführer oder eine Vorlese-App entwickelt, könnte schneller eine engere Auswahl treffen. Anschließend sollten die Kandidaten echte Inhalte lesen: Ortsnamen, Daten, Abkürzungen und längere Texte. Der praktische Gewinn wären weniger Sackgassen bei der Auswahl, nicht der schönste Vergleichsgraph.

Was noch zu lösen ist: Hörtests mit Muttersprachlern, Aussprachekontrollen und Tests auf dem Zielgerät. Beim Stimmenklonen kommen die Zustimmung der betroffenen Person und Schutz vor Missbrauch hinzu. Hohe Ähnlichkeit belegt keine Erlaubnis zur Nachahmung. Eine Rangliste ist Orientierung, kein Sicherheits- oder Kunstzertifikat.

Optimistischer Horizont: Für ein Team mit vorhandener Anwendung schätzen wir 1–3 Wochen für einen kleinen Vergleichspiloten. Ein Teil dieser Zeit sollte den Menschen gehören, die das Ergebnis tatsächlich hören werden. Das ist eine redaktionelle Schätzung für die erste Technikauswahl, kein Termin für perfekte Synchronisation oder vollständigen Einsatz.