OpenAI hat mit GPT Transcribe und GPT Live Transcribe zwei neue Spracherkennungsmodelle per API veröffentlicht. GPT Transcribe ist für fertige Audiodateien gedacht und verarbeitet Audio etwa 34-mal schneller als in Echtzeit. GPT Live Transcribe ist für Echtzeit-Streaming mit niedriger Latenz konzipiert.Laut Artificial Analysis, die den Benchmark AA-WER betreiben, erreicht GPT Transcribe eine Wortfehlerrate von 3,31 Prozent und verbessert sich um 0,7 Prozentpunkte gegenüber dem gut ein Jahr alten Vorgänger GPT-4o Transcribe. Der Preis sinkt gleichzeitig um 25 Prozent auf 0,45 Cent pro Minute Audio. Beide Modelle akzeptieren Text als Transkriptionskontext, Schlüsselwörter und mehrere Eingabesprachen.
Im AA-WER-Ranking liegt OpenAI damit aber weiterhin hinter ElevenLabs Scribe v2 (2,3 Prozent Fehlerrate), Googles Gemini 3 Pro (2,9 Prozent) und Mistrals Voxtral Small (3 Prozent). Mistral hatte erst kürzlich mit Voxtral Transcribe V2 ab 0,3 Cent pro Minute einen aggressiven Kampfpreis gesetzt. Details finden sich im Transcription Guide. Die neuen Transkriptionsmodelle ergänzen OpenAIs kürzlich vorgestellte Realtime-Modellgeneration, zu der auch das Echtzeit-Transkriptionsmodell GPT-Realtime-Whisper gehört.
KI-News ohne Hype – von Menschen kuratiert
Mit dem THE‑DECODER‑Abo liest du werbefrei und wirst Teil unserer Community: Diskutiere im Kommentarsystem, erhalte unseren wöchentlichen KI‑Newsletter, 6× im Jahr den "KI Radar"‑Frontier‑Newsletter mit den neuesten Entwicklungen aus der Spitze der KI‑Forschung, bis zu 25 % Rabatt auf KI Pro‑Events und Zugriff auf das komplette Archiv der letzten zehn Jahre.



