Article

Whisper ou Parakeet : quel modèle vocal choisir ?

Whisper et Parakeet TDT comparés simplement : architecture, vitesse, langues, précision, hallucinations et quand choisir quel modèle vocal sur l'appareil.

Whisper ou Parakeet, c'est le choix auquel se heurtent la plupart des gens qui exécutent un modèle vocal sur leur propre matériel, et les deux reposent sur des idées différentes. Cet article explique ces idées simplement, puis compare la vitesse, les langues, la précision, les horodatages et le comportement face aux hallucinations, et se termine par une règle courte pour savoir lequel prendre. Si vous ne voulez que la règle : Parakeet pour l'anglais et les grandes langues européennes quand la vitesse et la fidélité comptent, Whisper pour tout le reste.

D'où ils viennent

Whisper a été publié par OpenAI en 2022, entraîné sur une très grande quantité d'audio collectée sur le web, et diffusé sous forme d'une famille de tailles allant de tiny à large. Le grand modèle actuel est large-v3, avec une variante large-v3-turbo qui conserve l'encodeur et réduit le décodeur pour gagner en vitesse. Il transcrit une centaine de langues environ et peut aussi traduire la parole en anglais.

Parakeet est une famille de modèles de l'équipe NeMo de NVIDIA. Celui dont les gens parlent quand ils disent « Parakeet » est Parakeet TDT 0.6B, un modèle de 600 millions de paramètres. La version 2 est uniquement anglophone et s'est fait connaître en occupant le haut du classement Open ASR de Hugging Face, ou presque, tout en pesant une fraction de la taille de Whisper large. La version 3, publiée en 2025, l'étend à 25 langues européennes. Les deux sont diffusées sous une licence permissive.

Vous pouvez exécuter les deux sur un Mac ; le guide pas à pas de Whisper couvre la route par le Terminal.

L'architecture en mots simples

Whisper : écouter, puis écrire

Whisper est un transformeur encodeur-décodeur. L'encodeur écoute une fenêtre audio de 30 secondes et la transforme en une représentation compacte. Le décodeur écrit ensuite la transcription un jeton à la fois, et chaque nouveau jeton est choisi en regardant la représentation audio et tout ce qu'il a déjà écrit. Cette seconde partie compte : le décodeur est, en pratique, un modèle de langage qui se trouve être conditionné par de l'audio.

L'avantage, c'est la fluidité. Whisper produit un texte bien ponctué, avec les majuscules au bon endroit, se débrouille avec les accents et le bruit de fond grâce à la variété considérable de ses données d'entraînement, et peut utiliser le contexte de la fenêtre précédente pour garder les noms et les orthographes cohérents. L'inconvénient, c'est qu'écrire un jeton à la fois est lent, et qu'un modèle qui est en partie un modèle de langage continuera parfois d'écrire alors que l'audio ne dit plus rien.

Parakeet : décider à chaque instant

Parakeet TDT utilise un encodeur FastConformer qui alimente un décodeur à transducteur. Un transducteur parcourt l'audio image par image et décide à chaque étape : émettre un morceau de texte, ou émettre un « blanc » signifiant que rien de nouveau n'a été dit ici. Le texte est donc lié à la ligne de temps de l'audio ; le modèle ne peut pas produire un mot sans une trame audio à laquelle le rattacher.

Le sigle TDT signifie Token-and-Duration Transducer. Un transducteur simple doit examiner chaque trame, dont la plupart sont des blancs. TDT prédit, en même temps que chaque jeton, combien de trames sauter avant la décision suivante. Il franchit d'un bond les silences et le milieu des voyelles longues au lieu de les inspecter, et c'est de là que vient une grande partie de sa vitesse.

Le résultat est un modèle rapide, qui donne gratuitement des temps de mots précis, et qui invente rarement. Ce qu'il abandonne, c'est la fluidité du modèle de langage : il utilise moins bien le contexte lointain, et il est entraîné sur un ensemble de langues plus étroit.

Vitesse

C'est la différence la moins contestée. Parakeet TDT transcrit plusieurs fois plus vite que Whisper à précision égale. Sur un GPU de centre de données, le débit publié se compte en milliers de fois le temps réel ; sur un Mac Apple Silicon via Core ML, une heure d'audio se termine en bien moins d'une minute sur les puces récentes. Whisper large-v3 sur le même Mac prend de plusieurs minutes à quelques dizaines de minutes selon la puce et selon l'utilisation ou non du Neural Engine ; small et turbo réduisent l'écart sans le combler.

Si vous transcrivez beaucoup d'audio, cela peut à soi seul trancher la question.

Langues

Whisper couvre une centaine de langues environ, avec une précision qui décroît régulièrement de l'anglais aux grandes langues européennes et asiatiques, puis à celles qui disposent de peu de données d'entraînement. Il détecte aussi la langue automatiquement et peut traduire n'importe laquelle d'entre elles en anglais, une fonction que Parakeet n'a pas.

Parakeet TDT 0.6B v2 est uniquement anglophone. La version 3 couvre 25 langues européennes, dont les principales (allemand, français, espagnol, italien, portugais, néerlandais, polonais, russe) et beaucoup de plus petites, avec détection automatique de la langue parmi elles. Pour le japonais, le chinois, le coréen, l'arabe, le hindi et la plus grande partie du reste du monde, Whisper est la seule option des deux.

Précision

Sur les tests de référence en anglais, les deux sont proches, et Parakeet l'emporte souvent. Au moment de l'écriture, le classement Open ASR place Parakeet TDT 0.6B v2 avec un taux d'erreur de mots moyen dans la même fourchette que Whisper large-v3 ou meilleur, avec un cinquième du nombre de paramètres. Consultez le classement pour les chiffres actuels, car les deux projets publient des mises à jour.

Les tests de référence sont propres, cependant. En pratique :

  • Les accents marqués et le vocabulaire inhabituel tendent à favoriser les grands modèles de Whisper, parce qu'ils ont simplement entendu plus de variété.
  • Les chiffres, les dates et la mise en forme favorisent Parakeet, qui a été entraîné à les écrire comme les gens les tapent.
  • Les longs enregistrements favorisent Parakeet pour une raison subtile expliquée plus bas.
  • L'audio téléphonique bruité et les locuteurs qui se chevauchent sont difficiles pour les deux. Aucun ne sépare les locuteurs ; c'est une étape distincte appelée diarisation, expliquée dans la diarisation des locuteurs expliquée.

La réponse honnête est de tester les deux sur dix minutes de votre propre audio. Les différences qui comptent pour vous sauteront aux yeux.

Comportement face aux hallucinations

Le défaut le plus connu de Whisper découle de sa conception. Comme le décodeur est un modèle de langage, lui donner du silence, de la musique ou du bruit produit parfois un texte fluide et assuré que personne n'a prononcé : une phrase répétée une douzaine de fois, une formule comme « merci d'avoir regardé » à la fin d'un fichier, ou un paragraphe plausible par-dessus une longue pause. Cela arrive surtout au début et à la fin des enregistrements et autour des trous. Des parades existent, comme la détection d'activité vocale pour sauter les silences, la désactivation du report du texte précédent, et une nouvelle tentative avec une température d'échantillonnage différente, et les projets whisper.cpp et WhisperKit en embarquent certaines. Elles réduisent le problème ; elles ne le suppriment pas.

Le transducteur de Parakeet émet un blanc quand il n'entend rien. Il n'a aucun mécanisme pour écrire des phrases qui ne sont pas ancrées dans l'audio, donc le silence produit du silence. Son mode de défaillance est différent : un mot marmonné ressort faux ou disparaît, plutôt que d'être remplacé par un mot inventé. Pour des transcriptions sur lesquelles quelqu'un s'appuiera sans réécouter, un modèle qui omet est plus sûr qu'un modèle qui invente. Très rarement, un transducteur peut tout de même se bloquer en répétant un jeton sur une entrée pathologique, donc aucun modèle ne doit être cru aveuglément.

Horodatages et ponctuation

Whisper prédit les horodatages sous forme de jetons spéciaux dans sa sortie. Ils suffisent pour des sous-titres au niveau de la phrase mais n'ont jamais été entraînés pour être précis, et le calage au mot exige une étape d'alignement supplémentaire. Les temps de Parakeet découlent du transducteur lui-même : chaque jeton émis est lié à la trame où il a été décidé, donc les horodatages de mots sont précis sans travail supplémentaire. C'est pourquoi les apps qui vous laissent cliquer sur un mot pour entendre l'audio à cet endroit préfèrent en général les modèles à transducteur.

Les deux produisent la ponctuation et les majuscules ; celle de Whisper se lit un peu plus naturellement dans les longues phrases, celle de Parakeet est cohérente.

Longs enregistrements

Whisper traite l'audio par fenêtres de 30 secondes et, par défaut, transmet le texte de la fenêtre précédente comme contexte. Cela garde les orthographes cohérentes, mais cela signifie aussi qu'une mauvaise fenêtre peut empoisonner la suivante : une phrase hallucinée devient du contexte, le modèle la poursuit, et l'erreur se propage. Les outils qui exécutent Whisper désactivent souvent ce report pour cette raison, au prix d'un peu de cohérence.

Parakeet n'a pas de fenêtre au même sens ; les versions récentes utilisent une attention locale, donc un long fichier peut être traité en une seule passe, et il est de toute façon couramment découpé en morceaux de quelques minutes. Il n'y a pas de contexte textuel entre les morceaux, donc rien ne se propage.

Les exécuter sur un Mac

Whisper s'exécute via whisper.cpp (GPU par Metal, éventuellement le Neural Engine par Core ML) ou via WhisperKit (Core ML, Neural Engine par défaut). Parakeet s'exécute via la boîte à outils NeMo de NVIDIA avec PyTorch, ou via des conversions Core ML communautaires, qui sont ce que les apps Mac embarquent en général. Pour exécuter Parakeet localement sur Apple Silicon vous-même, la route Core ML est la voie pratique. Les deux tiennent confortablement en mémoire sur un Mac Apple Silicon et les deux sont en téléchargement gratuit.

Lequel choisir

Choisissez Parakeet TDT quand :

  • l'audio est en anglais ou dans l'une des 25 langues européennes de la v3,
  • vous voulez la transcription vite, ou sur la batterie d'un portable,
  • vous avez besoin de temps de mots précis,
  • la transcription sera utilisée sans réécoute, donc un texte inventé est pire qu'un mot manquant.

Choisissez Whisper quand :

  • la langue ne figure pas dans la liste de Parakeet,
  • vous avez besoin de la traduction vers l'anglais,
  • l'audio comporte des accents marqués ou un vocabulaire rare et vous pouvez vous permettre le grand modèle,
  • vous voulez la ponctuation la plus naturelle à lire pour une publication.

Beaucoup de gens finissent avec les deux et choisissent selon l'enregistrement. Pour la question préalable des modèles locaux face aux services cloud, voyez transcription sur l'appareil ou dans le cloud.

Questions fréquentes

Parakeet est-il meilleur que Whisper ?

Pour l'anglais et les langues européennes qu'il prend en charge, Parakeet TDT est en général aussi précis que le plus grand modèle de Whisper, plusieurs fois plus rapide, et bien moins susceptible d'inventer du texte sur du silence. Whisper est meilleur quand la langue ne figure pas dans la liste de Parakeet, quand vous avez besoin de la traduction vers l'anglais, ou sur un audio à accent marqué où l'étendue du grand modèle aide. Testez les deux sur vos propres enregistrements avant de décider.

Parakeet prend-il en charge d'autres langues que l'anglais ?

La version 2 de Parakeet TDT 0.6B est uniquement anglophone. La version 3 ajoute 25 langues européennes avec détection automatique, dont l'allemand, le français, l'espagnol, l'italien, le portugais, le néerlandais et le polonais. Elle ne couvre pas les langues asiatiques, moyen-orientales ou africaines ; pour celles-là, Whisper reste le choix pratique sur l'appareil.

Pourquoi Whisper hallucine-t-il ?

Le décodeur de Whisper est entraîné comme un modèle de langage, choisissant chaque mot à partir de l'audio et des mots qu'il a déjà écrits. Quand l'audio ne contient pas de parole, le second signal domine et le modèle produit un texte fluide qui sonne juste mais n'a jamais été dit. Le silence, la musique et les fins de fichiers le déclenchent le plus. La détection d'activité vocale et la désactivation du report de texte le réduisent.

Puis-je exécuter Parakeet sur un Mac ?

Oui. NVIDIA publie les poids, et ils s'exécutent via la boîte à outils NeMo ou via des conversions Core ML qui utilisent le Neural Engine sur Apple Silicon. La route Core ML est celle par laquelle les apps Mac l'embarquent et c'est l'option la plus rapide sur un portable. Il n'existe pas encore d'installeur officiel en une ligne comme pour whisper.cpp, donc la plupart des gens utilisent une app qui l'intègre.

Essayez l'alternative privée.

Téléchargement gratuit, avec des utilisations gratuites de chaque fonction Pro. Aucun compte nécessaire.

Download on the App StoreDownload on the App Store