Alibabas neues Text-to-Speech-Modell Qwen-Audio-3.0-TTS-Plus führt die Speech Arena Leaderboard von Artificial Analysis für Provider-Stimmen an. Mit einem Elo-Score von 1.236 liegt es knapp vor Simba 3.2 (1.234). Gemini 3.1 Flash TTS (1.214) und Sonic 3.5 (1.207) folgen dahinter.
Artificial AnalysisDas Modell gibt es laut dem Qwen-Team in zwei Varianten: Flash für Echtzeit-Interaktion mit rund 300 Millisekunden Latenz und Plus für hochwertige Sprachausgabe. Es unterstützt 16 Sprachen, darunter Deutsch, und mehrere chinesische Dialekte. Nutzer können den Sprechstil per natürlicher Sprache steuern oder mit Tags wie [angry] oder [giggles] nichtverbale Details einfügen. Zudem kommt das Modell laut Alibaba besser mit verrauschten oder halligen Referenzaufnahmen beim Stimmklonen zurecht als Vorgängerversionen. Bei der Geschwindigkeit liegt das Modell mit 16 Zeichen pro Sekunde allerdings weit hinter Sonic 3.5 (120) oder Simba 3.2 (30,2). Der Preis beträgt 27,60 Dollar pro Million Zeichen über Alibaba Cloud Model Studio. Zahlreiche Hörbeispiele gibt es hier.
KI-News ohne Hype – von Menschen kuratiert
Mit dem THE‑DECODER‑Abo liest du werbefrei und wirst Teil unserer Community: Diskutiere im Kommentarsystem, erhalte unseren wöchentlichen KI‑Newsletter, 6× im Jahr den "KI Radar"‑Frontier‑Newsletter mit den neuesten Entwicklungen aus der Spitze der KI‑Forschung, bis zu 25 % Rabatt auf KI Pro‑Events und Zugriff auf das komplette Archiv der letzten zehn Jahre.



