MP3、M4A、WAVのファイルは、分単位の料金を払わず、文字起こしサービスにファイルを送ることもなく、Macでテキストに文字起こしできます。いちばん早いのは、Mac自体で文字起こしするアプリを使う方法です。ファイルを入れて数分待ち、テキストを書き出すだけです。
このガイドでは、macOSに最初からある機能、自作の環境に実際に必要なこと、ThinkScribeでの手順を説明します。読み終えるころには、文字起こしがディスクに保存され、扱う音声の量に合うのはどの方法かがはっきりわかります。
始める前に
どの方法が合うかは、いくつかの点で決まります。
- お使いのMac。 Apple silicon搭載のMacは、古いIntel Macよりも何倍も速く音声モデルを動かせます。Mac版ThinkScribeには、Apple siliconとmacOS 26以降が必要です。
- 音声ファイル。 一般的な形式ならどれでも大丈夫です。mp3、m4a、wav、aiff、flac、ogg、opus、aac、そしてmp4やmovなどの動画ファイルも使えます。
- どのくらいの頻度か。 年に1回のインタビューと、毎週たまる会議の山とでは、問題が違います。1回なら気にならない設定の手間も、繰り返すと負担になります。
macOSに最初からある機能
ボイスメモとメモの文字起こし
最近のmacOSでは、「ボイスメモ」で録音したものの文字起こしを表示でき、「メモ」でも音声を録音して文字起こしを一緒に作れます。自分でどちらかのアプリで録音したなら、まずはそのアプリの文字起こし表示を探してみてください。
制限は実用面にあります。これらの機能はアプリ内で作った録音を前提にしているため、人から送られてきたMP3は想定された入力ではありません。対応言語は、お使いのmacOSのバージョンでAppleが対応しているものに限られます。話者ラベルも字幕の書き出しもなく、テキストを取り出すには選択してコピーするしかありません。詳しくはiPhoneとMacでのボイスメモの文字起こし(英語)で説明しています。
音声入力はファイルではなく、その場の声のためのもの
キーボードの音声入力(Appleのガイドを参照)は、マイクに向かって話した内容を文字にします。録音をスピーカーで再生して音声入力に聞かせる人もいますが、うまくいきません。部屋の反響や再生の音質で精度が落ち、リアルタイムでしか進まず(1時間の音声には1時間かかります)、間があくと音声入力は止まります。最後の手段と考えてください。
自作の環境に必要なこと
オープンな音声認識モデルはMacでも動かせるので、コマンドラインツールを組み合わせて自分で処理の流れを作る人もいます。始める前に、それが実際に何を意味するかを知っておく価値があります。
- スキルと時間。 開発者ツールをインストールし、モデルファイルをダウンロードし、録音ごとにモデルが求めるとおりの音声形式に変換します。何も問題が起きなくても、最初の設定にはたっぷり30分かかります。
- 維持。 ツールのアップデートでコマンド名やオプションが変わり、モデルには新しいバージョンが出ます。スクリプトが動かなくなったことに気づくのは自分です。
- それでも手に入らないもの。 話者ラベル、検索できるライブラリ、文をクリックして音声を聞く方法、要約、きれいな書き出しには、さらに別のツールが必要です。
- 品質の確認。 オープンなモデルの中には、長い無音や音楽の部分でありもしない文章を作るものがあるので、間のあたりの出力に目を通す必要があります。理由は音声モデルが幻覚を起こし、同じ言葉を繰り返す理由(英語)で説明しています。
文字起こしが一度きりの実験なら、それも楽しいでしょう。仕事の一部なら、時間は文字起こしではなく配管作業に消えていきます。
ThinkScribeでMacの音声をテキストに文字起こしする方法
- MacでThinkScribeを開きます。初回は、ウェルカム画面が必要な許可を案内します。
- ⌘I(「文字起こし」メニュー >「ファイルを読み込む…」)を押して1つ以上のファイルを選ぶか、「ドロップして読み込み」と表示されるまでウインドウにドラッグします。Finderでファイルを右クリックし、「このアプリケーションで開く」を使うこともできます。
- 話されている言語が設定されているか確認します。録音の言語を選ぶか、表示されていれば「自動検出」を選びます。ThinkScribeは28言語を文字起こしします。
- 文字起こしが作られ、話者が区別されるのを待ちます。文字起こしはMac上で実行されオフラインで動作するので、長いファイルでもアップロードを待つことはありません。
- ワークスペースで文字起こしを読みます。行をクリックするとその位置から音声が再生され、「話者1」「話者2」を実際の名前に変えられます。
- 書き出します。プレーンテキスト、SRT字幕、VTT字幕、JSON、Markdown、PDF、Word文書 のほか、メモに共有 も使えます。
まとめて読み込むなら、文字起こし後に自動書き出し をオンにすると、各ファイルが終わりしだい書き出されます。iPhoneとiPadも含めた読み込みの詳しい手順は音声・動画ファイルを文字起こしする(英語)にあります。
文字起こしの次にできること
テキストファイルは始まりにすぎないこともよくあります。Macのワークスペースでは、文字起こし の隣のタブで次のことができます。
- 会議やインタビューの 要約 と アクション項目(「表示」メニュー >「要約する」、⇧⌘S)。
- チャット では録音について質問でき、回答の出典をクリックするとその瞬間に移動します。
- マインドマップ は、講義や長い話をトピックのマップにします。
文字起こしで何度も間違える名前、専門用語、製品名は「設定」>「語彙」に追加できます。カスタム語彙(英語)をご覧ください。
どの方法を選ぶか
- ボイスメモやメモで録音した短いもので、言葉だけ必要: 内蔵の文字起こしを使います。
- いじるのが好きで、ときどき文字起こしする: 自作の環境でも、先に書いた維持の手間を受け入れられるなら使えます。
- インタビュー、会議、講義を定期的に扱い、話者の名前、検索できる文字起こし、すぐ使える書き出しが欲しい: アプリです。全体の流れは音声をテキストに文字起こしで、iPhoneとiPadも含めたことは音声からテキストへの完全ガイド(英語)で紹介しています。
オンデバイスとクラウドのサービスを比べているなら、オンデバイスとクラウドの文字起こし(英語)でその違いと分単位の料金の計算を説明しています。1つのファイルから復習に使えるものを作る実例なら、講義を録音して文字起こしする(英語)で、1本の録音を学習ノートに仕上げるまでを紹介しています。
よくある質問
MacでMP3を無料でテキストに文字起こしできますか?
できます。ThinkScribeはダウンロード無料で、文字起こしを含むすべてのPro機能の無料回数が付いているので、自分のファイルで試せます。最近のmacOSでは、ボイスメモとメモで録音したものも無料で文字起こしできますが、人から送られてきたMP3向けには作られていません。
Macには音声の文字起こし機能が内蔵されていますか?
一部はあります。キーボードの音声入力はその場の声を文字にし、最近のボイスメモとメモは自分のアプリで録音したものの文字起こしを表示できます。macOSには「このMP3を開いて文字起こしする」という内蔵機能はないので、多くの人はアプリを使います。
Macで1時間の音声を文字起こしするのにどのくらいかかりますか?
ファイルはMac自体で文字起こしされるので、インターネット接続ではなく、ファイルの長さとお使いのMacによって決まります。メモリの多いApple silicon搭載のMacほど速くなります。実行中もほかのアプリで作業を続けられ、まとめて読み込んだファイルは順番に処理されます。
インターネットなしでMacで音声を文字起こしできますか?
できます。ThinkScribeはMac上で文字起こしし、一度設定すればオフラインで動作するので、飛行機の中やWi-Fiをオフにした状態でも文字起こしできます。アカウントはなく、録音と文字起こしが私たちに送信されることはありません。