Grok Voice Transcribe 2.0: Weniger Hörfehler, gleicher Preis
Veröffentlicht am 18.09.2026
Schlechte Telefonleitungen, wechselnde Sprachen und vorgelesene E-Mail-Adressen bringen Spracherkennung schnell an ihre Grenzen. Mit Grok Voice Transcribe 2.0 will xAI genau dort nachbessern. Die neue Version führt die vorliegende Streaming-Rangliste von Artificial Analysis an und bleibt laut Anbieter beim bisherigen Preis.
Ein falsch verstandenes Wort ist manchmal nur ärgerlich. Bei einer Kontonummer, einem Produktnamen oder einem kurzen Sprachbefehl kann es jedoch den ganzen Vorgang ausbremsen. Mit Grok Voice Transcribe 2.0 stellt xAI eine neue Version seiner Spracherkennung vor, die gerade mit solchen Situationen besser zurechtkommen soll. Der Schwerpunkt liegt auf Audio, wie es im Alltag tatsächlich anfällt: mit Störgeräuschen, unterschiedlichen Akzenten und mehreren Stimmen.
Nach Angaben des Unternehmens basiert das Modell auf derselben Audio-Grundlage wie Grok Voice. Für das Training seien unter anderem mehrsprachige Aufnahmen aus unterschiedlichen, auch lauten Umgebungen verwendet worden. Die neue Version soll in den eigenen Praxistests doppelt so genau arbeiten wie ihr Vorgänger. Die Preise bleiben laut Ankündigung unverändert.
Gute Benchmark-Werte – mit klaren Grenzen
Ein konkreter Anhaltspunkt kommt von Artificial Analysis. In der beigefügten Streaming-Rangliste erreicht Grok Voice Transcribe 2.0 bei der endgültigen Transkription eine Wortfehlerrate von 2,7 Prozent. In der gezeigten Spitzengruppe folgen Muse Voice Transcribe mit 3,1 Prozent und Cartesia Ink-2 mit semantischer Erkennung des Sprechendes mit 3,4 Prozent.
Die Wortfehlerrate, kurz WER, erfasst Ersetzungen, Auslassungen und zusätzlich eingefügte Wörter im Vergleich zu einem Referenztext. Ein niedrigerer Wert ist besser. Der verwendete Index kombiniert drei Datensätze: AA-AgentTalk mit 50 Prozent Gewicht sowie VoxPopuli und Earnings22 mit jeweils 25 Prozent. Das Ergebnis beschreibt damit eine bestimmte Testmischung, keine universelle Genauigkeit für jede Sprache und jede Aufnahme.
Auch die Unterscheidung zwischen vorläufigem und endgültigem Text ist wichtig. Ein Streaming-System kann bereits während des Sprechens Text liefern und diesen später korrigieren. Der Spitzenwert von 2,7 Prozent betrifft die endgültige Fassung. Daraus lässt sich weder automatisch die beste Qualität der ersten Textausgabe noch die kürzeste Reaktionszeit ableiten.
Mehrsprachige Kurzbefehle machen den größten Sprung
Zusätzlich berichtet xAI über vier interne Testbereiche: Kundendiensttelefonate, Gespräche mit Grok, vorgelesene Zugangsdaten wie Kontocodes und E-Mail-Adressen sowie kurze mehrsprachige Sprachbefehle. In allen vier Bereichen soll die neue Version besser abschneiden als Grok Voice Transcribe 1.0. Bei Telefonaufnahmen beansprucht xAI zudem den Spitzenplatz unter den selbst getesteten Modellen.
Besonders deutlich fällt die genannte Verbesserung bei kurzen mehrsprachigen Äußerungen aus. Hier sinkt die Wortfehlerrate im internen Test von 20,6 auf 6,8 Prozent. Das entspricht einer relativen Verringerung um rund 67 Prozent. Gerade kurze Befehle sind anspruchsvoll, weil nur wenig Kontext zur Verfügung steht, um die Sprache und das Gemeinte zu erkennen.
Diese Zahlen stammen allerdings aus Tests des Herstellers. Sie sind getrennt vom öffentlichen Benchmark zu betrachten. Auch die pauschale Aussage „doppelt so genau“ sollte deshalb als Anbieterangabe gelesen werden und nicht als Garantie für eine halbierte Fehlerzahl bei jeder Aufnahme. Für einen eigenen Einsatz bleibt ein Test mit typischem Audiomaterial entscheidend.
Laut xAI unterstützt das Modell Dutzende Sprachen, erkennt die verwendete Sprache automatisch und kann Sprachwechsel innerhalb einer Aufnahme verarbeiten. Einen gesonderten Messwert für deutsche Aufnahmen nennt die vorliegende Ankündigung nicht.
Mehr als ein reines Wortprotokoll
Grok Voice Transcribe 2.0 verarbeitet sowohl gespeicherte Audiodateien und URLs als auch laufende Audiostreams. Zeitstempel und Konfidenzwerte auf Wortebene helfen dabei, Textstellen einer Aufnahme zuzuordnen und die vom Modell eingeschätzte Sicherheit zu berücksichtigen. Die Sprecherzuordnung kennzeichnet unterschiedliche Stimmen im Transkript; außerdem lassen sich bis zu acht Audiokanäle getrennt verarbeiten.
Pro Anfrage können bis zu 100 Fachbegriffe vorgegeben werden, etwa Produktnamen oder spezielles Vokabular. Weitere Funktionen formatieren Zahlen, Datumsangaben, Währungen, Telefonnummern und E-Mail-Adressen. Füllwörter lassen sich auslassen. Für Sprachassistenten ist zudem eine Funktion vorgesehen, die das Ende eines Redebeitrags erkennt.
Als Praxisbeispiel nennt die Ankündigung Atlassian Loom. Atlassian habe das Modell bei der Transkription von Loom-Videos als genauer als die bisherige Lösung bewertet. Beschrieben wird auch ein möglicher Arbeitsablauf, bei dem ein aufgezeichneter Handlungsplan über sein Transkript an den Programmierassistenten Cursor weitergegeben wird. Das zeigt den Nutzen guter Transkripte als Grundlage weiterer KI-Schritte; eine verlässliche Umsetzung beliebiger Videoanweisungen ist damit noch nicht belegt.
Preise bleiben, die Standardversion wechselt
Laut Ankündigung kostet die Verarbeitung gespeicherter Aufnahmen weiterhin 0,10 US-Dollar pro Audiostunde, Streaming 0,20 US-Dollar. Sprecherzuordnung, Zeitstempel und die Vorgabe von Fachbegriffen sind enthalten. Bestehende Integrationen der Speech-to-Text-API sollen die höhere Erkennungsqualität ohne Codeänderungen erhalten.
Zum Stand der Ankündigung soll Version 2.0 in Kürze zum Standard werden, während Version 1.0 in den folgenden Wochen auslaufen soll. Wer während der Übergangsphase beim Vorgänger bleiben möchte, kann laut xAI ausdrücklich grok-voice-transcribe-1.0 auswählen.
Die Kombination aus niedriger Wortfehlerrate, unveränderten Preisen und praktischen Zusatzfunktionen macht das Update vor allem für Video-Transkription, Kundendienst und Sprachassistenten interessant. Wie groß der Fortschritt im konkreten Betrieb ausfällt, hängt jedoch von den verwendeten Sprachen, der Aufnahmequalität und den Anforderungen an die Reaktionszeit ab.
xAI stellt Grok Voice Transcribe 2.0 vor: Das Spracherkennungsmodell erreicht im vorliegenden Streaming-Benchmark 2,7 Prozent Wortfehlerrate. Besonders bei kurzen mehrsprachigen Befehlen meldet der Anbieter Fortschritte. Die Preise bleiben unverändert, Funktionen wie Sprecherzuordnung und Zeitstempel sind enthalten.
Das Wichtigste in Kürze
Grok Voice Transcribe 2.0 soll Sprache auch dann zuverlässig in Text umwandeln, wenn Telefonleitungen schwächeln, mehrere Menschen sprechen oder die Sprache innerhalb einer Aufnahme wechselt. xAI verspricht gegenüber dem Vorgänger eine höhere Erkennungsqualität bei unveränderten Preisen.
Die wichtigsten Zahlen im Überblick
- Wortfehlerrate (final): 2,7 Prozent im Streaming-Benchmark von Artificial Analysis
- Spitzengruppe: vor Muse Voice Transcribe (3,1 Prozent) und Cartesia Ink-2 (3,4 Prozent)
- Mehrsprachige Kurzbefehle: Wortfehlerrate sinkt intern von 20,6 auf 6,8 Prozent
- Preise: 0,10 US-Dollar pro Audiostunde (Dateien), 0,20 US-Dollar (Streaming)
- Umfang: bis zu acht Audiokanäle, bis zu 100 Fachbegriffe pro Anfrage
Die beigefügte Rangliste von Artificial Analysis liefert dafür einen unabhängigen Anhaltspunkt: Bei der endgültigen Streaming-Transkription erzielt das Modell eine Wortfehlerrate von 2,7 Prozent und liegt damit in der gezeigten Spitzengruppe. Der Wert bezieht sich auf eine gewichtete Mischung aus drei Testdatensätzen. Er ist keine Garantie für dieselbe Qualität in jeder Sprache oder Aufnahmeumgebung.
Den größten internen Fortschritt meldet xAI für kurze mehrsprachige Sprachbefehle. Das Modell unterstützt laut Anbieter Dutzende Sprachen und erkennt Sprachwechsel automatisch. Die übergreifende Aussage, Version 2.0 sei „doppelt so genau“, stammt ebenfalls vom Hersteller und sollte nicht pauschal auf jede Anwendung übertragen werden.
Zum Funktionsumfang gehören die Verarbeitung gespeicherter Aufnahmen und laufender Streams, Zeitstempel auf Wortebene sowie die Kennzeichnung verschiedener Sprecher. Außerdem können Nutzer Füllwörter aus dem Text entfernen lassen. Als Anwendungsbeispiel nennt xAI Atlassian Loom: Der Anbieter von Bildschirmaufzeichnungen habe bei seinen Videos eine bessere Transkriptionsqualität als mit der bisherigen Lösung festgestellt.
Version 2.0 soll laut Ankündigung in Kürze zum API-Standard werden, Version 1.0 in den folgenden Wochen auslaufen. Für Anwender ist vor allem interessant, ob die gemessenen Verbesserungen auch bei ihren eigenen Aufnahmen ankommen.
Quellen
- Introducing Grok Voice Transcribe 2.0 – xAI
- Speech to Text Providers Leaderboard & Comparison – Artificial Analysis