Anleitung

Audio in Text umwandeln auf dem Mac: gratis und lokal

Drei Wege, Audio auf dem Mac in Text umzuwandeln, ohne Upload: Apples eigene Werkzeuge, whisper.cpp im Terminal und eine App, die es in einem Schritt macht.

Du kannst eine MP3-, M4A- oder WAV-Datei auf dem Mac in ein Textprotokoll verwandeln, ohne sie irgendwo hochzuladen und ohne pro Minute zu bezahlen. Diese Anleitung geht drei Wege durch: was macOS schon mitbringt, ein Open-Source-Setup mit whisper.cpp im Terminal und eine App, die dieselbe Arbeit in einem Schritt erledigt. Am Ende hast du ein einfaches Textprotokoll auf der Festplatte und eine klare Vorstellung davon, welcher Weg zu deiner Menge an Audio passt.

Bevor du anfängst

Ein paar Dinge entscheiden, welcher Weg sinnvoll ist:

  • Dein Mac. Apple Silicon (M1 oder neuer) führt Sprachmodelle um ein Vielfaches schneller aus als Intel. Alles hier funktioniert auch auf Intel, nur langsamer.
  • Dein Audio. Jedes gängige Format ist in Ordnung. Der Terminal-Weg wandelt es zuerst in WAV um, die anderen Wege nehmen die Datei so, wie sie ist.
  • Speicherplatz. Sprachmodelle sind Dateien, die du einmal herunterlädst. Die kleinen liegen deutlich unter einem Gigabyte, die größten Whisper-Modelle bei einigen Gigabyte.
  • Wie oft du das machst. Ein Interview im Jahr und ein wöchentlicher Stapel Meetings sind zwei verschiedene Probleme. Einrichtungszeit, die einmal in Ordnung ist, wird zur Last, sobald sie sich wiederholt.

Weg 1: was macOS dir schon gibt

Transkripte in Voice Memos und Notizen

Aktuelle macOS-Versionen können ein Transkript für Aufnahmen anzeigen, die in Voice Memos entstanden sind, und Notizen kann Audio aufnehmen und daneben ein Transkript erzeugen. Wenn du das Audio selbst in einer dieser Apps aufgenommen hast, sieh dort nach der Transkriptansicht, bevor du etwas installierst.

Die Grenzen sind eher praktischer als technischer Natur. Diese Funktionen sind um Aufnahmen herum gebaut, die in der App selbst entstehen, eine MP3 von jemand anderem ist also nicht die vorgesehene Eingabe. Die Sprachabdeckung hängt davon ab, welche Sprachen Apple in deiner macOS-Version für die Transkription auf dem Gerät unterstützt, sieh also beim Apple Support nach, wenn deine Sprache nicht Englisch ist. Es gibt keine Sprecherkennzeichnung, keinen Untertitel-Export, und den Text bekommst du nur durch Markieren und Kopieren heraus.

Das Diktat ist für Gesprochenes, nicht für Dateien

Das Tastaturdiktat (siehe Apples Anleitung) transkribiert, was du ins Mikrofon sprichst. Manche spielen eine Aufnahme über die Lautsprecher ab und lassen das Diktat mithören. Das funktioniert schlecht: Raumhall und Wiedergabequalität verschlechtern die Genauigkeit, es läuft in Echtzeit (eine Stunde Audio dauert eine Stunde), und das Diktat ist darauf ausgelegt, nach einer Pause zu stoppen. Das Audio intern über ein virtuelles Audiogerät zu leiten löst das Qualitätsproblem, aber nicht das Zeitproblem. Betrachte es als letzte Möglichkeit.

Wann Weg 1 genügt

Kurze Aufnahmen, die du selbst in Voice Memos oder Notizen gemacht hast, in einer gut unterstützten Sprache, bei denen du nur die Worte brauchst und keine Zeitmarken oder Sprechernamen. Für alles andere lies weiter.

Weg 2: whisper.cpp im Terminal (gratis, Open Source)

whisper.cpp ist eine C/C++-Implementierung von OpenAIs Sprachmodell Whisper. Es läuft vollständig auf deinem Mac, nutzt auf Apple Silicon die GPU und beherrscht rund hundert Sprachen. Es ist kostenlos, wird gut gepflegt und ist die verbreitetste Art, Dateien lokal auf einem Mac zu transkribieren. Es ist außerdem ein Kommandozeilenwerkzeug, rechne also beim ersten Einrichten mit zwanzig bis dreißig Minuten.

Schritt 1: Homebrew installieren

Falls du Homebrew noch nicht hast, öffne Terminal und führe den Installer von der Homebrew-Startseite aus:

/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

Folge den Hinweisen. Auf Apple Silicon endet der Installer damit, dass du Homebrew in den Pfad deiner Shell aufnehmen sollst, führe dazu die beiden ausgegebenen Zeilen aus.

Schritt 2: whisper.cpp und ffmpeg installieren

brew install whisper-cpp ffmpeg

ffmpeg wandelt dein Audio in das Format um, das whisper.cpp erwartet. Prüfe nach der Installation den Namen der Whisper-Binärdatei. Aktuelle Versionen installieren sie als whisper-cli, ältere nutzten whisper-cpp.

ls "$(brew --prefix)/bin" | grep -i whisper

Verwende in den folgenden Befehlen den Namen, der bei dir auftaucht.

Schritt 3: ein Modell herunterladen

Whisper gibt es in mehreren Größen. Kleine Modelle sind schnell und grob, große sind genau und langsam. Die Modelle im ggml-Format von whisper.cpp liegen auf der Hugging-Face-Seite des Projekts, verlinkt aus der README. Eine sinnvolle erste Wahl für Englisch ist base.en, für andere Sprachen nimmst du ein Modell ohne die Endung .en, etwa small oder large-v3.

mkdir -p ~/whisper-models
curl -L -o ~/whisper-models/ggml-base.en.bin \
  https://huggingface.co/ggerganov/whisper.cpp/resolve/main/ggml-base.en.bin

Wenn sich der Dateiname stromaufwärts ändert, kopiere den aktuellen aus der Modellliste in der README.

Schritt 4: das Audio in 16-kHz-Mono-WAV umwandeln

whisper.cpp liest 16-Bit-WAV mit 16 kHz. ffmpeg übernimmt die Umwandlung für jedes Eingangsformat:

ffmpeg -i recording.mp3 -ar 16000 -ac 1 -c:a pcm_s16le recording.wav

Tausche recording.mp3 gegen deine M4A-, FLAC-, OGG- oder Videodatei. Der Befehl bleibt derselbe.

Schritt 5: die Transkription starten

whisper-cli -m ~/whisper-models/ggml-base.en.bin -f recording.wav -otxt

Der Text läuft mit Zeitmarken durch, und neben dem Audio wird eine Datei namens recording.wav.txt geschrieben. Für eine nicht englische Aufnahme ergänzt du -l de (oder den passenden Sprachcode), oder -l auto, damit das Modell die Sprache erkennt. Ergänze -osrt oder -ovtt, wenn du Untertitel möchtest, die SRT-Anleitung behandelt die Korrektur des Timings.

Für Flags, Batch-Skripte, quantisierte Modelle und Fehlermeldungen findest du die vollständige Anleitung unter Whisper lokal auf dem Mac ausführen.

Was dich dieser Weg kostet

Ehrlich gerechnet: Das erste Einrichten dauert eine halbe Stunde, wenn nichts schiefgeht. Jede weitere Datei sind zwei Befehle und etwas Warten, auf einem Mac mit Apple Silicon liegt die Wartezeit mit einem kleinen Modell meist bei einem Bruchteil der Audiolänge und mit einem großen näher an der Echtzeit. Die Wartung ist real: brew upgrade benennt gelegentlich die Binärdatei um oder ändert ein Flag, Modelle bekommen neue Versionen, und du bist derjenige, der es merkt.

Was du nicht bekommst: Sprechernamen, eine durchsuchbare Bibliothek, die Möglichkeit, einen Satz anzuklicken und das Audio dazu zu hören, oder überhaupt eine grafische Oberfläche. Whisper kann bei langen Stillen auch Text erfinden, überfliege die Ausgabe rund um Pausen also kurz.

Weg 2b: WhisperKit CLI

WhisperKit ist Argmax' Umsetzung von Whisper auf Core ML, wodurch es auf Apple Silicon die Neural Engine nutzen kann. Zum Zeitpunkt des Schreibens beschreibt die README eine Installation über Homebrew und einen Unterbefehl transcribe, der einen Audiopfad direkt entgegennimmt, der ffmpeg-Schritt entfällt also, und Modelle werden bei der ersten Nutzung geladen. Sieh in der README nach der aktuellen Installationszeile und den Flags. Der erste Lauf kompiliert das Modell für deinen Chip und kann einige Minuten dauern, danach geht es schnell. Wenn du ein Werkzeug zwei Werkzeugen vorziehst, ist das die aufgeräumtere Terminal-Variante. Wenn du lieber Parakeet als Whisper nutzt, behandelt Parakeet selbst ausführen den Core-ML-Weg auf Apple Silicon.

Die Alternative in einem Schritt

Die App-Seite hat ihre eigene Anleitung: Erste Schritte mit ThinkScribe auf dem Mac behandelt den ersten Import, die Wahl der Engine und die Einstellungen, die man einmal ändern sollte.

Welcher Weg passt

  • Du hast es in Voice Memos oder Notizen aufgenommen, es ist kurz und auf Englisch: nimm das eingebaute Transkript.
  • Gelegentliche Dateien, du magst das Terminal, du brauchst keine Sprechernamen: whisper.cpp.
  • Du willst die Neural Engine und ein einziges Werkzeug: WhisperKit CLI.
  • Regelmäßige Interviews, Meetings oder Vorlesungen, mit benannten Sprechern und durchsuchbaren Transkripten: eine App. Auf der Seite Audio in Text umwandeln siehst du, wie dieser Ablauf von Anfang bis Ende aussieht.

Ein durchgerechnetes Beispiel von einer Datei bis zu etwas, mit dem du weiterarbeiten kannst, findest du unter eine Vorlesung aufnehmen und transkribieren, das eine einzelne Aufnahme bis zu Lernnotizen führt.

Was auch immer du wählst, alle drei Wege behalten das Audio auf deinem Mac. Wenn du lokal gegen Cloud-Dienste abwägst, behandelt Transkription auf dem Gerät gegen Cloud die Abwägungen und die Rechnung pro Minute.

Häufig gestellte Fragen

Kann ich eine MP3 auf dem Mac kostenlos in Text umwandeln?

Ja. whisper.cpp und WhisperKit sind gratis und Open Source, und aktuelle macOS-Versionen können Aufnahmen aus Voice Memos und Notizen ohne Kosten transkribieren. Die kostenlosen Wege brauchen einen Umwandlungsschritt und eine Terminal-Sitzung, oder sie akzeptieren nur Aufnahmen aus Apples eigenen Apps. Bezahl-Apps kaufen dir vor allem Zeit, Sprechernamen und Exporte.

Hat der Mac eine eingebaute Audiotranskription?

Teilweise. Das Tastaturdiktat transkribiert gesprochene Sprache, und aktuelle Versionen von Voice Memos und Notizen können Transkripte ihrer eigenen Aufnahmen anzeigen. Eine eingebaute Funktion nach dem Muster "öffne diese MP3 und transkribiere sie" gibt es in macOS nicht, und genau deshalb installieren die meisten whisper.cpp oder eine App.

Wie lange dauert es, eine Stunde Audio auf dem Mac zu transkribieren?

Auf einem Mac mit Apple Silicon schafft ein kleines Whisper-Modell eine Stunde Audio in wenigen Minuten, ein großes Modell kann fast so lange brauchen wie die Aufnahme selbst. Parakeet TDT, das manche Apps anbieten, ist noch schneller. Intel-Macs sind bei allen Varianten deutlich langsamer. Die Wahl des Modells zählt mehr als alles andere.

Ist die lokale Transkription auf dem Mac privat?

Ja, in dem Sinne, auf den es ankommt: Audio und Text verlassen die Maschine nie. Bei whisper.cpp ist der Modell-Download der einzige Netzwerkverkehr. Das nimmt bei vertraulichen Aufnahmen die Frage nach der Verarbeitung durch einen Anbieter aus der Gleichung, formale Anforderungen solltest du aber mit deiner eigenen Compliance-Beratung klären.

Probier die private Alternative.

Kostenlos herunterladen, mit Gratis-Nutzungen jeder Pro-Funktion. Kein Konto nötig.

Download on the App StoreDownload on the App Store