先に結論を3行で。
- 日本語で使うなら、迷う必要はほぼありません。large-v3-turbo が事実上の正解です。公式に「largeを最適化したもので、精度の低下を最小限に抑えつつ、より速い」と書かれています。
- 容量が気になるなら量子化版を使います。当社の製品ではlarge-v3-turboの量子化版で約550MB。largeの2.9GiBと比べて5分の1以下です。
- tinyやbaseに落とすのは筋が悪いです。日本語の固有名詞が目に見えて崩れるわりに、速さは「常駐させる」ほうがはるかに効きます。
Whisperを自分で動かすとき、最初に迷うのがモデル選びです。公式の数字を並べて、実務での選び方まで書きます。確認日:2026年8月17日。
公式のモデル表
OpenAIの公式リポジトリに載っている表です。
| モデル | パラメータ数 | 必要なVRAM | 相対的な速さ |
|---|---|---|---|
| tiny | 3,900万 | 約1GB | 約10倍 |
| base | 7,400万 | 約1GB | 約7倍 |
| small | 2億4,400万 | 約2GB | 約4倍 |
| medium | 7億6,900万 | 約5GB | 約2倍 |
| large | 15億5,000万 | 約10GB | 1倍(基準) |
| turbo | 8億900万 | 約6GB | 約8倍 |
turboだけ、明らかに別格です。largeの半分ほどの大きさで、8倍速い。公式の説明はこうです。
turboモデルは large-v3 を最適化したもので、精度の低下を最小限に抑えつつ、より速い文字起こしを実現します。
もう少し中身を言うと、モデルカードにこう書かれています。
Whisper large-v3-turbo は、枝刈りした Whisper large-v3 を追加学習させたものです。言い換えると、デコードの層が32から4に減っているだけで、まったく同じモデルです。
「別物の小さいモデル」ではなく「largeの一部を削ったもの」という理解でよいです。だから精度がそれほど落ちません。
ディスクをどれだけ食うか
whisper.cppで配られているモデルファイルの実サイズです。
| モデル | ディスク |
|---|---|
| tiny | 75MiB |
| base | 142MiB |
| small | 466MiB |
| medium | 1.5GiB |
| large | 2.9GiB |
量子化でさらに小さくできる
量子化は、数値の細かさを落として軽くする加工です。同じモデルでも、ファイルがぐっと小さくなります。
当社の製品ではlarge-v3-turboの量子化版を使っていて、約550MBです。largeの2.9GiBと比べて5分の1以下。精度の落ち方は、日本語の実務では気になりませんでした。
「largeが良さそうだけど重い」で止まっている方は、まずturboの量子化版を試してみてください。ここが今のいちばん現実的な着地点です。
★大事なこと:速さはモデルでは決まらない
ここを外すと選び方を間違えます。当社が実際に測った数字です。
| やり方 | 1回あたりの時間 |
|---|---|
| コマンドを都度呼ぶ(毎回モデルを読み直す) | 9.4秒 |
| 常駐させておく(読み込みっぱなしにする) | 0.5〜0.8秒 |
測定環境は MacBook Air(Apple M5・メモリ24GB)、モデルはlarge-v3-turbo(547MB)です。
10倍以上の差があります。しかもこれはモデルを小さくしても埋まりません。読み込みにかかる時間なので、むしろモデルが大きいほど効いてきます。
つまり「遅いからtinyに落とす」より「常駐させる」ほうが、桁違いに効きます。順番を間違えないでください。くわしくはWhisperをローカルで動かす文字起こしに書きました。
用途別の選び方
| 用途 | おすすめ | 理由 |
|---|---|---|
| 日本語の音声入力・文字起こし | large-v3-turbo(量子化版) | 精度と速さと容量のつり合いがいちばん良い |
| とにかく精度を上げたい(時間は気にしない) | large-v3 | turboはデコードの層を削っているので、理屈のうえでは上限が高い |
| 古い機種・メモリが少ない | smallの量子化版 | mediumは1.5GiBで重くなりがち |
| 英語だけ・短い語だけ | base / small | 英語のみのモデル(.en付き)もあります |
| 日本語で tiny / base | おすすめしません | 固有名詞が目に見えて崩れます。速さは常駐で稼ぐほうが得 |
Macで動かすときの追加の一手
Apple Siliconのmacなら、whisper.cppを使うとさらに速くなります。公式にこうあります。
Apple Siliconの端末では、エンコーダの推論をCore ML経由でApple Neural Engine(ANE)で実行できます。CPUのみの実行と比べて3倍以上の高速化になります。
効く順番をまとめると、こうなります。
- 常駐させる(9.4秒 → 0.5〜0.8秒)← 桁違い
- turboを選ぶ(largeの約8倍)
- Apple Neural Engineを使う(CPUのみと比べて3倍以上)
- 量子化する(容量が5分の1以下)
ライセンスの確認を忘れずに
Whisperは無料で商用にも使えますが、使うモデルごとに配布元の表記を確認してください。2026年8月17日時点で確認した範囲では、次のとおりでした。
| 配布元 | ライセンス表記 |
|---|---|
| OpenAIの公式リポジトリ(コードと重み) | MIT |
| large-v3-turbo のモデルカード | MIT |
| ggml形式の配布リポジトリ(whisper.cpp用) | MIT |
| large-v3 のモデルカード | Apache-2.0 |
| large-v2 のモデルカード | Apache-2.0 |
同じOpenAIの掲載でも、モデルによって表記が違います。turboを使うならMITですが、モデルを差し替えるときは必ず取り直してください。
自分で組まない場合
- 組み方を知りたい → Whisperをローカルで動かす文字起こし/リアルタイムはできるか/「ご視聴ありがとうございました」が入る問題
- できあがったものを使いたい → ローカルで完結する音声入力アプリロカオンは、large-v3-turboの量子化版(約550MB)を常駐させています(当社製品です)。人名や社名を登録する「じぶん辞書」があり、音声も文字も端末の外に送りません。年払いで年6,600円(月あたり550円・税込)です。1日10回まで(1回1分まで)なら無料で使え、最初の10日間は回数の制限もありません
ロカオンはmacOS 26以降(Apple Silicon)のMacが必要で、Windowsには対応していません。ご購入後は、ライセンスの確認だけ1日1回・数十バイトの通信をします(音声や文字は送りません。つながらない日が続いても14日間は使え、過ぎても無料版として使えます)。
この記事の調べ方
- モデル表とturboの説明、ライセンス(MIT)はOpenAIの公式リポジトリ(2026年8月17日確認)。引用は原文の訳です。
- turboが「枝刈りしたlarge-v3の追加学習」であることはlarge-v3-turboのモデルカード(同日確認)。
- ディスクサイズ、Apple Neural Engineで3倍以上はwhisper.cppの公式リポジトリ(同日確認)。
- ライセンス表記は各配布元のメタデータを機械的に取得して確認しました(同日)。
- 9.4秒/0.5〜0.8秒/量子化して約550MBは、当社が2026年8月に実機で測った値です。環境は MacBook Air(Apple M5・メモリ24GB)。他の環境で同じ数字になることを保証するものではありません。
本メディア「ロカオン研究室」は、ローカルで完結する音声入力アプリ「ロカオン」を開発する合同会社ヒバナが運営しています。他社製品も、当社製品と同じ物差しで確認して書きます。記事中の他社製品の権利は各社に帰属します。

