Transcrire un audio en texte sur Mac, gratuit et local
Trois façons de transcrire un audio en texte sur Mac sans rien envoyer en ligne : les outils intégrés d'Apple, whisper.cpp dans le Terminal, et une app locale.
Vous pouvez transformer un fichier MP3, M4A ou WAV en transcription texte sur un Mac sans le téléverser nulle part et sans payer à la minute. Ce guide parcourt trois routes : ce que macOS contient déjà, une installation open source avec whisper.cpp dans le Terminal, et une app qui fait le même travail en une seule étape. À la fin, vous aurez une transcription en texte brut sur le disque et une idée claire de la route qui correspond au volume d'audio que vous traitez.
Avant de commencer
Quelques éléments décident de la route qui a du sens :
- Votre Mac. Apple Silicon (M1 ou plus récent) exécute les modèles vocaux plusieurs fois plus vite qu'Intel. Tout ce qui suit fonctionne aussi sur Intel, simplement plus lentement.
- Votre audio. N'importe quel format courant convient. La route Terminal le convertit d'abord en WAV ; les autres routes prennent le fichier tel quel.
- L'espace disque. Les modèles vocaux sont des fichiers que vous téléchargez une fois. Les petits pèsent nettement moins d'un gigaoctet ; les plus gros modèles Whisper font quelques gigaoctets.
- La fréquence. Un entretien par an et une pile de réunions par semaine sont deux problèmes différents. Un temps d'installation acceptable une fois devient un impôt quand il se répète.
Route 1 : ce que macOS vous donne déjà
Les transcriptions dans Voice Memos et Notes
Les versions récentes de macOS peuvent afficher une transcription pour les enregistrements réalisés dans Voice Memos, et Notes peut enregistrer de l'audio et produire une transcription à côté. Si vous avez enregistré l'audio vous-même dans l'une de ces apps, cherchez la vue transcription dans l'app avant d'installer quoi que ce soit.
Les limites sont pratiques plutôt que techniques. Ces fonctions sont construites autour des enregistrements créés dans l'app, donc un MP3 que quelqu'un vous a envoyé n'est pas l'entrée prévue. La couverture linguistique dépend des langues qu'Apple prend en charge pour la transcription sur l'appareil dans votre version de macOS, alors consultez l'assistance Apple si votre langue n'est pas l'anglais. Il n'y a pas d'étiquettes de locuteurs, pas d'export de sous-titres, et récupérer le texte revient à le sélectionner et à le copier.
La dictée sert à la parole en direct, pas aux fichiers
La dictée au clavier (voir le guide d'Apple) transcrit ce que vous dites au micro. Certaines personnes diffusent un enregistrement dans les haut-parleurs et laissent la dictée écouter. Cela fonctionne mal : l'écho de la pièce et la qualité de la lecture dégradent la précision, cela se déroule en temps réel (une heure d'audio prend une heure), et la dictée est conçue pour s'arrêter après une pause. Router l'audio en interne avec un périphérique audio virtuel aide pour la qualité, mais pas pour la durée. À considérer comme un dernier recours.
Quand la route 1 suffit
Des enregistrements courts que vous avez faits vous-même dans Voice Memos ou Notes, dans une langue bien prise en charge, quand vous n'avez besoin que des mots et ni des horodatages ni des noms de locuteurs. Pour tout le reste, continuez à lire.
Route 2 : whisper.cpp dans le Terminal (gratuit, open source)
whisper.cpp est une implémentation en C/C++ du modèle vocal Whisper d'OpenAI. Il s'exécute entièrement sur votre Mac, utilise le GPU sur Apple Silicon et gère une centaine de langues environ. Il est gratuit, bien maintenu, et c'est la manière la plus courante de transcrire des fichiers localement sur un Mac. C'est aussi un outil en ligne de commande, donc comptez vingt à trente minutes pour la première installation.
Étape 1 : installer Homebrew
Si vous n'avez pas encore Homebrew, ouvrez le Terminal et lancez l'installeur depuis la page d'accueil de Homebrew :
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"
Suivez les invites. Sur Apple Silicon, l'installeur se termine en vous demandant d'ajouter Homebrew au chemin de votre shell ; exécutez les deux lignes qu'il affiche.
Étape 2 : installer whisper.cpp et ffmpeg
brew install whisper-cpp ffmpeg
ffmpeg convertit votre audio dans le format attendu par whisper.cpp. Après l'installation, vérifiez le nom du binaire whisper. Les versions actuelles l'installent sous le nom whisper-cli ; les anciennes utilisaient whisper-cpp.
ls "$(brew --prefix)/bin" | grep -i whisper
Utilisez le nom qui apparaît dans les commandes ci-dessous.
Étape 3 : télécharger un modèle
Whisper existe en plusieurs tailles. Les petits modèles sont rapides et approximatifs, les grands sont précis et lents. Les modèles au format ggml de whisper.cpp sont publiés sur la page Hugging Face du projet, liée depuis le README. Un premier choix raisonnable pour l'anglais est base.en ; pour d'autres langues, prenez un modèle sans le suffixe .en, comme small ou large-v3.
mkdir -p ~/whisper-models
curl -L -o ~/whisper-models/ggml-base.en.bin \
https://huggingface.co/ggerganov/whisper.cpp/resolve/main/ggml-base.en.bin
Si le nom de fichier change en amont, copiez le nom actuel depuis la liste des modèles dans le README.
Étape 4 : convertir l'audio en WAV mono 16 kHz
whisper.cpp lit du WAV 16 bits à 16 kHz. ffmpeg fait la conversion depuis n'importe quel format d'entrée :
ffmpeg -i recording.mp3 -ar 16000 -ac 1 -c:a pcm_s16le recording.wav
Remplacez recording.mp3 par votre fichier M4A, FLAC, OGG ou vidéo. La commande est la même.
Étape 5 : lancer la transcription
whisper-cli -m ~/whisper-models/ggml-base.en.bin -f recording.wav -otxt
Le texte défile avec des horodatages et un fichier nommé recording.wav.txt est écrit à côté de l'audio. Pour un enregistrement qui n'est pas en anglais, ajoutez -l fr (ou le code de langue concerné), ou -l auto pour laisser le modèle la détecter. Ajoutez -osrt ou -ovtt si vous voulez des sous-titres ; le guide SRT couvre les corrections de synchronisation.
Pour les options, les scripts par lots, les modèles quantifiés et les messages d'erreur, la marche à suivre complète se trouve dans Exécuter Whisper localement sur un Mac.
Ce que cette route vous coûte
Comptabilité honnête : la première installation prend une demi-heure si rien ne se passe mal. Chaque fichier ensuite représente deux commandes et une attente ; sur un Mac Apple Silicon, l'attente correspond en général à une fraction de la durée de l'audio avec un petit modèle, et se rapproche du temps réel avec un grand. La maintenance est réelle : brew upgrade renomme parfois le binaire ou change une option, les modèles reçoivent de nouvelles versions, et c'est vous qui vous en apercevez.
Ce que vous n'obtenez pas : des noms de locuteurs, une bibliothèque consultable, un moyen de cliquer sur une phrase pour entendre l'audio, ni la moindre interface graphique. Whisper peut aussi inventer du texte pendant les longs silences, alors parcourez la sortie autour des pauses.
Route 2b : WhisperKit CLI
WhisperKit est l'implémentation de Whisper par Argmax sur Core ML, ce qui lui permet d'utiliser le Neural Engine sur Apple Silicon. À l'heure où ces lignes sont écrites, le README documente une installation par Homebrew et une sous-commande transcribe qui prend directement un chemin audio, donc l'étape ffmpeg n'est pas nécessaire ; les modèles se téléchargent à la première utilisation. Consultez le README pour la ligne d'installation et les options actuelles. La première exécution compile le modèle pour votre puce et peut prendre quelques minutes, après quoi c'est rapide. Si vous préférez un seul outil à deux, c'est l'option Terminal la plus propre. Si vous préférez Parakeet à Whisper, exécuter Parakeet vous-même couvre la route Core ML sur Apple Silicon.
L'alternative en une étape
Le côté app a sa propre marche à suivre : démarrer avec ThinkScribe sur Mac couvre le premier import, le choix du moteur et les réglages qui valent la peine d'être changés une fois.
Quelle route choisir
- Vous l'avez enregistré dans Voice Memos ou Notes, c'est court, c'est en anglais : utilisez la transcription intégrée.
- Des fichiers occasionnels, vous aimez le Terminal, vous n'avez pas besoin d'étiquettes de locuteurs : whisper.cpp.
- Vous voulez le Neural Engine et un seul outil : WhisperKit CLI.
- Des entretiens, des réunions ou des cours réguliers, vous voulez des locuteurs nommés et des transcriptions consultables : une app. Voyez la page transcrire un audio en texte pour voir à quoi ressemble ce flux de bout en bout.
Pour un exemple concret allant d'un fichier à quelque chose que vous pouvez réviser, enregistrer et transcrire un cours suit un seul enregistrement jusqu'aux notes de révision.
Quel que soit votre choix, les trois routes gardent l'audio sur votre Mac. Si vous comparez le local aux services en ligne, transcription sur l'appareil ou dans le cloud couvre les compromis et le calcul au tarif à la minute.
Questions fréquentes
Puis-je transcrire un MP3 en texte sur un Mac gratuitement ?
Oui. whisper.cpp et WhisperKit sont gratuits et open source, et les versions récentes de macOS peuvent transcrire les enregistrements de Voice Memos et de Notes sans frais. Les routes gratuites demandent une étape de conversion et une session dans le Terminal, ou n'acceptent que les enregistrements faits dans les apps d'Apple. Les apps payantes vous achètent surtout du temps, des étiquettes de locuteurs et des exports.
Le Mac dispose-t-il d'une transcription audio intégrée ?
En partie. La dictée au clavier transcrit la parole en direct, et les versions récentes de Voice Memos et de Notes peuvent afficher les transcriptions de leurs propres enregistrements. Il n'existe pas de fonction intégrée « ouvrir ce MP3 et le transcrire » dans macOS, ce qui explique pourquoi la plupart des gens installent whisper.cpp ou une app.
Combien de temps faut-il pour transcrire une heure d'audio sur un Mac ?
Sur un Mac Apple Silicon, un petit modèle Whisper termine une heure d'audio en quelques minutes ; un grand modèle peut prendre presque la durée de l'enregistrement. Parakeet TDT, proposé dans certaines apps, est encore plus rapide. Les Mac Intel sont nettement plus lents pour tous. Le choix du modèle compte plus que tout le reste.
Transcrire de l'audio localement sur un Mac est-il confidentiel ?
Oui, au sens qui compte : l'audio et le texte ne quittent jamais la machine. Avec whisper.cpp, le seul trafic réseau est le téléchargement du modèle. Cela écarte la question du traitement par un prestataire pour les enregistrements confidentiels, même s'il vous revient de confirmer toute exigence formelle auprès de votre propre conseil en conformité.