Transkripte lokal am Mac zusammenfassen mit Ollama
So fasst du ein Transkript lokal auf deinem Mac mit Ollama zusammen: Installation, Modell laden, ein Prompt, der taugt, lange Transkripte teilen, Alternative.
Du kannst aus einem langen Transkript eine Zusammenfassung, eine Aufgabenliste oder ein Besprechungsprotokoll auf deinem eigenen Mac machen, ohne Cloud-API und ohne Guthaben, indem du ein Sprachmodell lokal mit Ollama ausführst. Diese Anleitung bringt dich von einem leeren Terminal zu einem funktionierenden Werkzeug, das auch Transkripte verarbeitet, die länger sind als das Kontextfenster des Modells, und zeigt danach die Variante in einem Schritt, die in einer Transkriptions-App eingebaut ist.
Der Selbstbauweg funktioniert gut. Er kostet dich etwa eine halbe Stunde Einrichtung, etwas Speicherplatz für das Modell und ein wenig Skriptarbeit für lange Dateien. Nichts, was du hineingibst, verlässt die Maschine.
Was du brauchst
- Einen Mac mit Apple Silicon. Modelle laufen über Metal auf der GPU, und 16 GB Arbeitsspeicher sind ein bequemes Minimum für die Klasse von 7B bis 8B, die bei Zusammenfassungen gute Arbeit leistet. 8 GB funktionieren mit kleineren Modellen, mit schwächeren Ergebnissen.
- Ein Transkript als einfache Textdatei. Wenn du noch nur Audio hast, wandle es zuerst auf dem Mac in Text um.
- Homebrew oder den Installer von ollama.com.
Schritt 1: Ollama installieren
Ollama ist eine Open-Source-Laufzeitumgebung, die Modelle lädt, sie lokal ausführt und eine einfache Kommandozeile sowie eine lokale HTTP-API bereitstellt. Installiere es mit Homebrew:
brew install ollama
Starte dann den Server. Homebrew kann ihn als Hintergrunddienst laufen lassen:
brew services start ollama
Oder lass ihn in einem Terminal-Fenster laufen, das du offen lässt:
ollama serve
Wenn du stattdessen den Installer von ollama.com genommen hast, startet die App in der Menüleiste den Server für dich.
Prüfe, ob er antwortet:
ollama --version
Schritt 2: ein Modell laden
Modelle werden über ihren Namen aus der Ollama-Bibliothek geladen. Für Zusammenfassungen auf einem Mac mit 16 GB ist ein allgemeines, auf Anweisungen trainiertes Modell im Bereich von 7B bis 8B der Sweet Spot. Zwei sinnvolle Optionen zum Zeitpunkt des Schreibens sind:
ollama pull llama3.1
ollama pull qwen2.5
Das Laden holt einmalig mehrere Gigabyte. Sieh in der Ollama-Modellbibliothek nach aktuellen Namen und Größen, denn die ändern sich. Auf einem Mac mit 8 GB nimmst du stattdessen ein 3B-Modell, zum Beispiel llama3.2 oder qwen2.5:3b.
Probiere es interaktiv aus:
ollama run llama3.1
Tippe eine Frage, bekomme eine Antwort, und tippe dann /bye, um zu gehen.
Schritt 3: ein Prompt, der brauchbare Zusammenfassungen erzeugt
Modelle fassen schlecht zusammen, wenn man sie bittet, "das hier zusammenzufassen". Sie sind gut, wenn man ihnen das Publikum, die Form der Ausgabe und das Wegzulassende nennt. Sichere das hier als summary-prompt.txt:
You are summarizing a meeting transcript for someone who was not there.
Write in plain English. Do not invent anything that is not in the transcript.
If the transcript does not contain something, say so rather than guessing.
Produce:
1. A two-sentence overview of what the meeting was about.
2. Key decisions, as a bulleted list. Include who decided if it is clear.
3. Action items, as a bulleted list in the form "Owner: task (deadline if stated)".
4. Open questions that were raised but not resolved.
Transcript follows.
Jetzt lass es laufen. Ollama nimmt das Prompt als Argument entgegen und liest weitere Eingaben von der Standardeingabe, du kannst also die Prompt-Datei und das Transkript zusammen hineingeben:
cat summary-prompt.txt transcript.txt | ollama run llama3.1 > summary.md
Öffne summary.md. Für ein Transkript von bis zu rund zwanzig Minuten gesprochener Sprache klappt das meist beim ersten Versuch. Für alles Längere lies weiter.
Ändere die Zeile zum Publikum und die nummerierte Liste, und dasselbe Prompt bewältigt andere Arten von Aufnahmen. Für aus einer Vorlesung Lernnotizen machen fragst du nach Definitionen, den Ergebnissen, auf die es ankommt, und einem Satz Fragen zum Beantworten aus dem Gedächtnis, statt nach Entscheidungen und Aufgaben.
Schritt 4: das Problem mit dem Kontextfenster
Jedes Modell hat eine maximale Zahl an Tokens, die es auf einmal betrachten kann, und Ollama führt Modelle mit einem eher kurzen Standardfenster aus, solange man nichts anderes sagt. Ist das Transkript länger als dieses Fenster, wird der Anfang stillschweigend verworfen, und die Zusammenfassung beschreibt klammheimlich nur das Ende der Besprechung. Nichts warnt dich.
Zwei Abhilfen, gemeinsam eingesetzt:
Die Kontextlänge erhöhen
Setze beim Ausführen des Modells ein größeres Fenster. In einer interaktiven Sitzung:
/set parameter num_ctx 16384
Oder setze es für jeden Lauf über die Umgebungsvariable, die Ollama zum Zeitpunkt des Schreibens beachtet:
OLLAMA_CONTEXT_LENGTH=16384 ollama serve
Größere Fenster brauchen mehr Speicher und verzögern das erste Token. Auf einem Mac mit 16 GB sind 16k Tokens mit einem 8B-Modell meist in Ordnung. Sieh auf der Modellkarte in der Bibliothek nach, welches Maximum es unterstützt.
Eine grobe Umrechnung: Eine Minute Gesprächssprache sind rund 150 Wörter, und 150 Wörter sind rund 200 Tokens. Eine einstündige Besprechung ergibt also etwa 12.000 Tokens vor dem Prompt. Ein zweistündiger Workshop passt selbst in ein großzügiges Fenster nicht, womit wir beim Aufteilen wären.
Lange Transkripte aufteilen
Die verlässliche Methode ist Map-Reduce: das Transkript in Teile zerlegen, die bequem passen, jeden Teil zusammenfassen und dann die Zusammenfassungen der Teile zusammenfassen. Sichere das hier als summarize.sh:
#!/bin/bash
# Usage: ./summarize.sh transcript.txt
set -e
MODEL=llama3.1
IN="$1"
WORK=$(mktemp -d)
# 1. Split into chunks of about 6,000 words.
split -l 400 "$IN" "$WORK/chunk_"
# 2. Summarize every chunk.
for f in "$WORK"/chunk_*; do
{
echo "Summarize this part of a meeting transcript. Keep every decision,"
echo "action item, name, number and date. Use bullet points. Transcript:"
cat "$f"
} | ollama run "$MODEL" > "$f.summary"
done
# 3. Combine the partial summaries into the final one.
{
cat summary-prompt.txt
cat "$WORK"/chunk_*.summary
} | ollama run "$MODEL"
rm -rf "$WORK"
Mach es ausführbar und starte es:
chmod +x summarize.sh
./summarize.sh transcript.txt > summary.md
Zwei Hinweise zum Skript. split -l 400 teilt nach Zeilen, die Stückgröße hängt also davon ab, wie dein Transkript umbricht; passe die Zahl an, bis jedes Stück deutlich unter deinem Kontextfenster liegt. Und der letzte Durchgang bekommt Teilzusammenfassungen statt des Transkripts, Details, die eine Teilzusammenfassung weggelassen hat, sind also endgültig weg. Genau deshalb sagt Schritt 2 dem Modell, es solle Namen, Zahlen und Daten behalten.
Schritt 5: Fragen stellen statt zusammenfassen
Dasselbe Setup beantwortet Fragen zu einem Transkript. Ersetze das Prompt durch die Frage:
{ echo "Answer using only the transcript below. Quote the relevant lines. Question: What did we agree about the launch date?"; cat transcript.txt; } | ollama run llama3.1
Das ist oft nützlicher als eine Zusammenfassung, wenn du schon weißt, wonach du suchst. Die Grenzen sind dieselben: Das ganze Transkript muss ins Fenster passen, und das Modell kann dir nicht zeigen, an welcher Stelle im Audio eine zitierte Zeile gesagt wurde.
Die lokale HTTP-API nutzen
Für alles, was du automatisieren willst, lauscht Ollama auf localhost:11434. Ein minimaler Aufruf:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.1",
"prompt": "Summarize: ...",
"stream": false,
"options": { "num_ctx": 16384 }
}'
Die API-Referenz liegt im Ollama-GitHub-Repository. Kurzbefehle, Automator oder ein kleines Python-Skript können sie aufrufen, um jede neue Datei in einem Ordner zusammenzufassen.
Was dich der Selbstbauweg kostet
Sei realistisch mit dem Aufwand. Du musst Ollama und das Modell aktuell halten, an die Einstellung der Kontextlänge denken, dein Aufteilungsskript im Takt mit den Transkripten halten, die du erzeugst, und die Ergebnisse dorthin kopieren, wo deine Notizen leben. Es ist ein gutes Wochenendprojekt und ein feines dauerhaftes Setup für jemanden, der Freude am Terminal hat. Es passt schlecht zu jemandem, der einfach nach jedem Gespräch ein Protokoll will.
Die Alternative in einem Schritt
Sind die Aufnahmen Vorlesungen statt Besprechungen, führt aus einer Vorlesungsaufnahme Lernnotizen machen durch dieselbe Kette von der Aufnahme bis zum Wiederholungsmaterial. Zusammenfassungen lassen sich direkt an Apple Notizen schicken, und Transkripte exportieren als TXT, Markdown, PDF oder DOCX. Es setzt macOS 26 oder neuer auf einem Mac mit Apple Silicon und 16 GB Arbeitsspeicher voraus, also ungefähr dieselbe Maschine, die der Selbstbauweg möchte.
Häufig gestellte Fragen
Kann ich ein Transkript mit Ollama ohne Internet zusammenfassen?
Ja. Sobald das Modell geladen ist, läuft Ollama vollständig auf dem Mac. Du kannst dich vom Netz trennen, und die Zusammenfassung entsteht genauso. Eine Verbindung braucht es nur, um ein Modell zu laden oder zu aktualisieren.
Welches Ollama-Modell eignet sich am besten für Besprechungstranskripte?
Zum Zeitpunkt des Schreibens geben allgemeine, auf Anweisungen trainierte Modelle im Bereich von 7B bis 8B, etwa die aktuellen Llama- oder Qwen-Versionen, das beste Gleichgewicht aus Qualität und Tempo auf einem Mac mit 16 GB. Größere Modelle sind genauer, aber langsam und speicherhungrig; 3B-Modelle sind schnell, übersehen in langen Transkripten aber gern Details. Probiere zwei aus und vergleiche sie an derselben Besprechung.
Wie lang darf ein Transkript sein, das ein lokales LLM zusammenfasst?
So lang du willst, wenn du es aufteilst. In einem einzigen Durchgang ist die Grenze das Kontextfenster des Modells: bei rund 200 Tokens pro Minute Sprache fasst ein 16k-Fenster ungefähr eine Stunde Gespräch plus das Prompt. Darüber hinaus teilst du das Transkript und fasst in Stufen zusammen.
Ist eine lokale LLM-Zusammenfassung so gut wie eine aus der Cloud?
Für Besprechungszusammenfassungen und Aufgabenlisten ist ein gutes 8B-Modell nah genug dran, dass die meisten den Unterschied nicht bemerken. Cloud-Modelle gewinnen weiterhin bei sehr langen Dokumenten, feinem Schlussfolgern und seltenen Sprachen. Für die private, alltägliche Aufgabe, aus einem einstündigen Gespräch Notizen zu machen, ist lokal mehr als ausreichend und kostet pro Nutzung nichts.