VOICE INPUT LAB

ロカオン研究室

音声入力アプリの比較・検証・使い方を、実測ベースで。

Whisperをローカルで動かす文字起こし。自分のMacだけで完結させる方法と限界

パソコンの中にマイクと歯車が収まり破線の輪で囲まれた手描き風イラスト 仕組みを知る

先に結論を3行で。

  • Whisperはコードもモデルの重みもMITライセンスで公開されていて、自分のMacの中だけで文字起こしができます。音声はどこにも送られません。
  • Macで現実的なのはwhisper.cppです。公式に「Apple Siliconは第一級市民」と書かれていて、エンコーダをApple Neural Engineで動かすとCPUだけのときより3倍以上速くなります。
  • いちばん大きな落とし穴は速さではなく「毎回モデルを読み直すと1回9.4秒かかる」ことです。常駐させれば0.5〜0.8秒。当社の実測値です。ここを外すと「使えない」という結論になります。

Whisper(ウィスパー)はOpenAIが公開している音声認識のモデルです。クラウドのサービスとしても使えますが、手元のMacだけで動かすこともできます。この記事では、実際にやるとどうなるか——どのモデルを選び、どこで詰まるか——を実測値つきでまとめます。確認日:2026年8月17日。

Whisperは何ができて、いくらか

OpenAIの公式リポジトリには「Whisperのコードとモデルの重みはMITライセンスで公開されています」と明記されています。料金はかかりません。対応言語は99言語で、日本語も含まれます。

モデルは大きさ違いで用意されています。公式の表がこれです。

モデル パラメータ数 必要なVRAM 相対的な速さ
tiny 3,900万 約1GB 約10倍
base 7,400万 約1GB 約7倍
small 2億4,400万 約2GB 約4倍
medium 7億6,900万 約5GB 約2倍
large 15億5,000万 約10GB 1倍(基準)
turbo 8億900万 約6GB 約8倍

注目すべきはturboです。公式の説明は「turboはlarge-v3を最適化したもので、精度の低下を最小限に抑えつつ、より速い文字起こしができます」。largeに近い精度で約8倍速いということなので、日本語の実務では基本これを選ぶことになります。

Macで動かすなら whisper.cpp

Python版をそのまま動かす手もありますが、Macではwhisper.cpp(C++で書き直したもの・MITライセンス)が現実的です。公式リポジトリにこう書かれています。

Apple Silicon first-class citizen – optimized via ARM NEON, Accelerate framework, Metal and Core ML
(Apple Siliconは第一級市民 ― ARM NEON、Accelerateフレームワーク、Metal、Core MLで最適化済み)

さらに、「Apple Siliconの端末では、エンコーダの推論をCore ML経由でApple Neural Engine(ANE)で実行できます。CPUのみの実行と比べて3倍以上の高速化になります」とも書かれています。M1以降のMacを持っているなら、この恩恵をそのまま受けられます。

ディスクをどれだけ食うか

whisper.cppのモデルファイルの実サイズはこうです。

モデル ディスク
tiny 75MiB
base 142MiB
small 466MiB
medium 1.5GiB
large 2.9GiB

「量子化」(数値の精度を落として軽くする加工)をすると、さらに小さくできます。参考までに、当社の製品ではlarge-v3-turboの量子化版を使っていて、約550MBです。largeの2.9GiBと比べると5分の1以下で、精度の落ち方は実務では気になりませんでした。

★いちばんの落とし穴:毎回モデルを読み直すと9.4秒かかる

ここが本題です。コマンドを叩くたびにモデルを読み込む作りにすると、1回の文字起こしに9.4秒かかります。当社が実際に測った数字です。

やり方 1回あたりの時間
コマンドを都度呼ぶ(毎回モデルを読み直す) 9.4秒
常駐させておく(whisper-server方式) 0.5〜0.8秒

測定条件は、MacBook Air(Apple M5・メモリ24GB)、モデルはlarge-v3-turbo(547MB)です。10倍以上の差があります。

この差は「速いか遅いか」ではなく、「使えるか使えないか」の差です。9.4秒待たされる音声入力は誰も使いません。0.8秒なら実用になります。ネットの記事で「Whisperをローカルで動かしたら遅かった」と書かれているものの多くは、ここが原因だと考えて差し支えありません。モデルの大きさやMacの性能の話ではなく、読み込みっぱなしにしているかどうかです。

自分で組むなら、常駐させる形(サーバーとして立ち上げっぱなしにする)を最初から前提にしてください。

もうひとつの限界:固有名詞は勝手には直らない

ローカルで動かしても、お客様の名前や社内用語が化ける問題は残ります。「渡邊」が「渡辺」になる、社内でしか使わない略語が別の言葉になる。これはモデルを大きくしても消えません。

Whisperには、あらかじめ単語を教えておく仕組み(プロンプト)があります。ただし当社が実装したときに踏んだ落とし穴が3つありました。同じところで詰まる人が多いはずなので、そのまま書きます。

落とし穴 どうなるか 対処
無音検出(VAD)を入れる 2文目以降に単語リストが渡らなくなる VADを使わない。余計な認識は後処理で消す
起動時にまとめて単語を渡す 効かない 1回1回の依頼ごとに単語リストを送る
単語を入れすぎる 逆に効かなくなる 当社の実装では185字が上限。枠に入らない語は、認識したあとの置き換えで直す

とくに2つ目は気づきにくく、「単語を登録したのに効かない」と悩む原因になります。

リアルタイムにはならない(別の話)

「話しながら画面に文字が出ていく」形にしたい場合、Whisperはそのままでは向いていません。Whisperは30秒のかたまりを前提に設計されているためです。理由と実用ラインはWhisperでリアルタイム文字起こしはできる?にまとめました。

自分で組むか、出来合いを使うか

ここまでの内容は、裏を返せば「自分で組むなら、常駐させて、単語リストを毎回送って、上限を守る」という作業が要るということです。技術的に難しくはありませんが、面倒ではあります。

用途別に、素直に並べます。

  • 仕組みを理解したい・自由に改造したい → whisper.cppを自分で動かすのがいちばんです。MITライセンスなので商用利用もできます。
  • 録音ファイルをまとめて文字にしたい → 常駐は不要なので、コマンドで回して構いません。9.4秒の話は、1回ずつ短く使う場合の問題です。
  • 日々の入力に使いたい(話して、その場で文字にしたい) → 出来合いのアプリのほうが早いです。ローカルで完結する音声入力アプリロカオンは、まさにここまでの落とし穴を全部踏んだうえで作りました(当社製品です)。large-v3-turboの量子化版(約550MB)を常駐させていて、人名や社名を登録する「じぶん辞書」があり、画面もメニューも日本語です。年払いで年6,600円(月あたり550円・税込)です。1日10回まで(1回1分まで)なら無料で使え、最初の10日間は回数の制限もありません。

ロカオンはmacOS 26以降(Apple Silicon)のMacが必要で、Windowsには対応していません。

この記事の調べ方

  • Whisperのライセンス・モデル表・turboの説明はOpenAIの公式リポジトリの記載(2026年8月17日確認)。引用文は原文のままです。
  • 対応99言語と「30秒の受容野」はlarge-v3のモデルカード(同日確認)。
  • ライセンスは、使うモデルごとに配布元の表記を確認してください。2026年8月17日時点で確認した範囲では、公式リポジトリ・large-v3-turboのモデルカード・ggml形式の配布リポジトリはいずれもMITでした。一方でlarge-v3とlarge-v2のモデルカードはApache-2.0と表記されています(同じOpenAIの掲載でも場所によって違います)。turboを使う場合はMITですが、モデルを差し替えるときは必ず取り直してください。
  • Apple Silicon対応・Core MLで3倍以上・モデルのディスクサイズ・0.5秒ごとの実時間サンプルはwhisper.cppの公式リポジトリ(同日確認)。
  • 9.4秒/0.5〜0.8秒、および単語リストの3つの落とし穴(VAD・起動時プロンプト・185字上限)は、当社が2026年8月に実機で測った値です。環境は MacBook Air(Apple M5・メモリ24GB)/large-v3-turbo(547MB)。他の環境で同じ数字になることを保証するものではありません。

本メディア「ロカオン研究室」は、ローカルで完結する音声入力アプリ「ロカオン」を開発する合同会社ヒバナが運営しています。他社製品も、当社製品と同じ物差しで確認して書きます。記事中の他社製品の権利は各社に帰属します。

神林瑛治の似顔絵

この記事を書いた人

神林 瑛治 かんばやし えいじ

合同会社ヒバナ 代表/ローカルで完結する音声入力アプリ「ロカオン」開発者

自分で音声入力アプリを開発しながら、このラボで各社の製品を同じ物差しで実測しています。ふだんの業務も毎日音声入力で回しています。

© 2026 合同会社ヒバナ