Whisper oder Parakeet: welches Sprachmodell ist besser?
Whisper und Parakeet TDT im Vergleich: Architektur, Tempo, Sprachen, Genauigkeit, Halluzinationen und wann welches lokale Spracherkennungsmodell passt.
Whisper oder Parakeet ist die Wahl, vor der die meisten stehen, wenn sie ein Sprachmodell auf eigener Hardware ausführen, und die beiden bauen auf verschiedenen Ideen auf. Dieser Artikel erklärt diese Ideen in klaren Worten, vergleicht dann Tempo, Sprachen, Genauigkeit, Zeitmarken und das Verhalten bei Halluzinationen und endet mit einer kurzen Regel dafür, welches du nehmen solltest. Wenn du nur die Regel willst: Parakeet für Englisch und die großen europäischen Sprachen, wenn Tempo und Texttreue zählen, Whisper für alles andere.
Woher sie kommen
Whisper wurde 2022 von OpenAI veröffentlicht, auf einer sehr großen Menge aus dem Web gesammelten Audios trainiert und als Familie von Größen von tiny bis large publiziert. Das aktuelle große Modell ist large-v3, mit einer Variante large-v3-turbo, die den Encoder behält und den Decoder für mehr Tempo verkleinert. Es transkribiert rund hundert Sprachen und kann Sprache außerdem ins Englische übersetzen.
Parakeet ist eine Modellfamilie aus dem NeMo-Team von NVIDIA. Das Modell, das gemeint ist, wenn jemand "Parakeet" sagt, ist Parakeet TDT 0.6B, ein Modell mit 600 Millionen Parametern. Version 2 kann nur Englisch und wurde dafür bekannt, an oder nahe der Spitze des Open ASR Leaderboards von Hugging Face zu stehen und dabei einen Bruchteil der Größe von Whisper large zu haben. Version 3, 2025 veröffentlicht, erweitert es auf 25 europäische Sprachen. Beide stehen unter einer freizügigen Lizenz.
Du kannst beide auf einem Mac ausführen; die Whisper-Anleitung behandelt den Weg über das Terminal.
Architektur in klaren Worten
Whisper: erst hören, dann schreiben
Whisper ist ein Encoder-Decoder-Transformer. Der Encoder hört ein 30-Sekunden-Fenster Audio und macht daraus eine kompakte Repräsentation. Der Decoder schreibt dann das Transkript Token für Token, und jedes neue Token wird gewählt, indem er auf die Audio-Repräsentation und auf alles Bisherige blickt, was er schon geschrieben hat. Dieser zweite Teil zählt: Der Decoder ist im Grunde ein Sprachmodell, das zufällig auf Audio konditioniert ist.
Der Vorteil ist Flüssigkeit. Whisper erzeugt gut interpunktierten Text mit korrekter Groß- und Kleinschreibung, kommt wegen der schieren Vielfalt seiner Trainingsdaten mit Akzenten und Hintergrundgeräuschen zurecht und kann den Zusammenhang aus dem vorigen Fenster nutzen, um Namen und Schreibweisen konsistent zu halten. Der Nachteil ist, dass Token für Token zu schreiben langsam ist, und dass ein Modell, das teilweise ein Sprachmodell ist, manchmal weiterschreibt, wenn das Audio aufgehört hat, etwas zu sagen.
Parakeet: in jedem Moment entscheiden
Parakeet TDT nutzt einen FastConformer-Encoder, der einen Transducer-Decoder speist. Ein Transducer läuft Bild für Bild durch das Audio und entscheidet bei jedem Schritt: ein Stück Text ausgeben oder ein "blank" ausgeben, was bedeutet, dass hier nichts Neues gesagt wurde. Der Text ist dadurch an die Zeitachse des Audios gebunden; das Modell kann kein Wort erzeugen, ohne einen Audio-Frame, an den es sich hängt.
Das TDT steht für Token-and-Duration Transducer. Ein einfacher Transducer muss jeden Frame ansehen, von denen die meisten blanks sind. TDT sagt zusammen mit jedem Token voraus, wie viele Frames bis zur nächsten Entscheidung übersprungen werden können. Es springt über Stille und über die Mitte langer Vokale, statt sie zu prüfen, und daher kommt ein großer Teil seines Tempos.
Das Ergebnis ist ein Modell, das schnell ist, genaue Wortzeitmarken gratis liefert und selten erfindet. Was es aufgibt, ist die Flüssigkeit eines Sprachmodells: Es kann weitreichenden Zusammenhang weniger gut nutzen, und es ist auf einer engeren Auswahl von Sprachen trainiert.
Tempo
Das ist der am wenigsten strittige Unterschied. Parakeet TDT transkribiert bei gleicher Genauigkeit um ein Vielfaches schneller als Whisper. Auf einer GPU im Rechenzentrum liegt der veröffentlichte Durchsatz in der Größenordnung des Tausendfachen der Echtzeit; auf einem Mac mit Apple Silicon über Core ML ist eine Stunde Audio auf aktuellen Chips deutlich unter einer Minute fertig. Whisper large-v3 braucht auf demselben Mac mehrere Minuten bis zu Dutzenden von Minuten, je nach Chip und danach, ob die Neural Engine genutzt wird; small und turbo verkleinern den Abstand, schließen ihn aber nicht.
Wenn du viel Audio transkribierst, kann das allein die Frage entscheiden.
Sprachen
Whisper deckt etwa hundert Sprachen ab, mit einer Genauigkeit, die von Englisch über die großen europäischen und asiatischen Sprachen bis zu jenen mit wenig Trainingsdaten stetig abfällt. Es erkennt die Sprache außerdem automatisch und kann jede davon ins Englische übersetzen, eine Funktion, die Parakeet nicht hat.
Parakeet TDT 0.6B v2 kann nur Englisch. Version 3 deckt 25 europäische Sprachen ab, darunter die großen (Deutsch, Französisch, Spanisch, Italienisch, Portugiesisch, Niederländisch, Polnisch, Russisch) und viele kleinere, mit automatischer Spracherkennung unter ihnen. Für Japanisch, Chinesisch, Koreanisch, Arabisch, Hindi und den größten Teil des Rests der Welt ist Whisper von beiden die einzige Möglichkeit.
Genauigkeit
In englischen Benchmarks liegen die beiden eng beieinander, und Parakeet gewinnt oft. Zum Zeitpunkt des Schreibens führt das Open ASR Leaderboard Parakeet TDT 0.6B v2 mit einer durchschnittlichen Wortfehlerrate im selben Bereich wie Whisper large-v3 oder besser, bei einem Fünftel der Parameterzahl. Sieh im Leaderboard nach aktuellen Zahlen, denn beide Projekte veröffentlichen Aktualisierungen.
Benchmarks sind allerdings sauber. In der Praxis gilt:
- Starke Akzente und ungewöhnliches Vokabular sprechen eher für Whispers größere Modelle, weil die schlicht mehr Vielfalt gehört haben.
- Zahlen, Datumsangaben und Formatierung sprechen für Parakeet, das darauf trainiert wurde, sie so zu schreiben, wie Menschen sie tippen.
- Lange Aufnahmen sprechen aus einem feinen Grund für Parakeet, der weiter unten steht.
- Rauschendes Telefonaudio und überlappende Sprecher sind für beide schwer. Keines trennt Sprecher; das ist ein eigener Schritt namens Diarisierung, erklärt in Sprecherkennung erklärt.
Die ehrliche Antwort ist, beide an zehn Minuten deines eigenen Audios zu testen. Die Unterschiede, die für dich zählen, werden offensichtlich sein.
Verhalten bei Halluzinationen
Whispers bekanntester Makel folgt aus seiner Bauart. Weil der Decoder ein Sprachmodell ist, erzeugt es, wenn man ihm Stille, Musik oder Rauschen vorsetzt, manchmal selbstbewussten, flüssigen Text, den niemand gesagt hat: einen dutzendfach wiederholten Satz, eine Phrase wie "thanks for watching" am Ende einer Datei oder einen plausiblen Absatz über einer langen Pause. Am häufigsten passiert das am Anfang und Ende von Aufnahmen und rund um Lücken. Es gibt Gegenmittel, etwa Sprachaktivitätserkennung, um Stille zu überspringen, das Abschalten der Übernahme vorherigen Textes und einen erneuten Versuch mit einer anderen Sampling-Temperatur, und die Projekte whisper.cpp und WhisperKit liefern einige davon mit. Sie verkleinern das Problem; sie beseitigen es nicht.
Parakeets Transducer gibt ein blank aus, wenn er nichts hört. Er hat keinen Mechanismus, Sätze zu schreiben, die nicht an Audio verankert sind, Stille erzeugt also Stille. Sein Fehlerbild ist ein anderes: Ein genuscheltes Wort kommt falsch heraus oder fällt weg, statt durch ein erfundenes ersetzt zu werden. Für Transkripte, auf die sich jemand verlässt, ohne noch einmal hineinzuhören, ist ein Modell, das auslässt, sicherer als eines, das erfindet. Sehr selten kann auch ein Transducer bei pathologischer Eingabe in der Wiederholung eines Tokens hängen bleiben, keinem Modell sollte man also blind vertrauen.
Zeitmarken und Interpunktion
Whisper sagt Zeitmarken als besondere Tokens in seiner Ausgabe voraus. Sie sind für Untertitel auf Satzebene gut genug, wurden aber nie auf Präzision trainiert, und Zeitmarken auf Wortebene brauchen zusätzlich einen Ausrichtungsschritt. Parakeets Zeiten fallen aus dem Transducer selbst heraus: Jedes ausgegebene Token ist an den Frame gebunden, an dem es entschieden wurde, Wortzeitmarken sind also ohne Mehrarbeit genau. Deshalb bevorzugen Apps, in denen du auf ein Wort klicken und das Audio an dieser Stelle hören kannst, meist Transducer-Modelle.
Beide erzeugen Interpunktion und Groß- und Kleinschreibung; Whispers liest sich in langen Sätzen etwas natürlicher, Parakeets ist konsistent.
Lange Aufnahmen
Whisper verarbeitet Audio in 30-Sekunden-Fenstern und gibt standardmäßig den Text des vorigen Fensters als Zusammenhang mit hinein. Das hält Schreibweisen konsistent, bedeutet aber auch, dass ein schlechtes Fenster das nächste vergiften kann: Ein halluzinierter Satz wird zum Zusammenhang, das Modell setzt ihn fort, und der Fehler pflanzt sich fort. Werkzeuge, die Whisper ausführen, schalten diese Übernahme aus genau diesem Grund oft ab, auf Kosten von etwas Konsistenz.
Parakeet hat kein Fenster im selben Sinn; aktuelle Versionen nutzen lokale Aufmerksamkeit, eine lange Datei kann also in einem Durchgang verarbeitet werden, und in der Praxis wird sie ohnehin meist in Stücke von einigen Minuten geteilt. Zwischen den Stücken gibt es keinen Textzusammenhang, es pflanzt sich also nichts fort.
Sie auf einem Mac ausführen
Whisper läuft über whisper.cpp (GPU über Metal, optional die Neural Engine über Core ML) oder über WhisperKit (Core ML, standardmäßig die Neural Engine). Parakeet läuft über NVIDIAs NeMo-Toolkit mit PyTorch oder über Core-ML-Umwandlungen aus der Community, was Mac-Apps typischerweise einbetten. Um Parakeet lokal auf Apple Silicon auszuführen, ist der Core-ML-Weg der praktische. Beide passen auf einem Mac mit Apple Silicon bequem in den Speicher, und beide sind gratis zum Laden.
Wann du welches nimmst
Nimm Parakeet TDT, wenn:
- das Audio Englisch oder eine der 25 europäischen Sprachen aus v3 ist,
- du das Transkript schnell willst, oder auf dem Laptop-Akku,
- du genaue Wortzeitmarken brauchst,
- dem Transkript vertraut wird, ohne noch einmal hineinzuhören, erfundener Text also schlimmer ist als ein fehlendes Wort.
Nimm Whisper, wenn:
- die Sprache nicht auf Parakeets Liste steht,
- du eine Übersetzung ins Englische brauchst,
- das Audio starke Akzente oder seltenes Vokabular hat und du dir das große Modell leisten kannst,
- du die für eine Veröffentlichung am natürlichsten lesbare Interpunktion willst.
Viele landen am Ende bei beiden und wählen pro Aufnahme. Zur grundsätzlicheren Frage lokale Modelle gegen Cloud-Dienste siehe Transkription auf dem Gerät gegen Cloud.
Häufig gestellte Fragen
Ist Parakeet besser als Whisper?
Für Englisch und die europäischen Sprachen, die es unterstützt, ist Parakeet TDT meist so genau wie Whispers größtes Modell, mehrfach schneller und viel weniger anfällig dafür, über Stille Text zu erfinden. Whisper ist besser, wenn die Sprache nicht auf Parakeets Liste steht, wenn du eine Übersetzung ins Englische brauchst oder bei stark akzentuiertem Audio, wo die Breite des großen Modells hilft. Teste beide an deinen eigenen Aufnahmen, bevor du entscheidest.
Unterstützt Parakeet andere Sprachen als Englisch?
Version 2 von Parakeet TDT 0.6B kann nur Englisch. Version 3 ergänzt 25 europäische Sprachen mit automatischer Erkennung, darunter Deutsch, Französisch, Spanisch, Italienisch, Portugiesisch, Niederländisch und Polnisch. Asiatische, nahöstliche und afrikanische Sprachen deckt es nicht ab; dafür bleibt Whisper die praktische Wahl auf dem Gerät.
Warum halluziniert Whisper?
Whispers Decoder ist wie ein Sprachmodell trainiert und wählt jedes Wort aus dem Audio und aus den Worten, die er bereits geschrieben hat. Enthält das Audio keine Sprache, dominiert das zweite Signal, und das Modell erzeugt flüssigen Text, der richtig klingt, aber nie gesagt wurde. Stille, Musik und Dateienden lösen es am ehesten aus. Sprachaktivitätserkennung und das Abschalten der Textübernahme verringern es.
Kann ich Parakeet auf einem Mac ausführen?
Ja. NVIDIA veröffentlicht die Gewichte, und sie laufen über das NeMo-Toolkit oder über Core-ML-Umwandlungen, die auf Apple Silicon die Neural Engine nutzen. Der Core-ML-Weg ist der, über den Mac-Apps es einbetten, und die schnellste Möglichkeit auf einem Laptop. Einen offiziellen Einzeiler-Installer wie bei whisper.cpp gibt es noch nicht, die meisten nutzen also eine App, die es mitbringt.