VOICE INPUT LAB

ロカオン研究室

音声入力アプリの比較・検証・使い方を、実測ベースで。

Whisperのモデルはどれを選ぶ?tinyからlarge-v3-turboまで、日本語での選び方

大きさの違う箱3つとマイクを描いた手描き風イラスト 仕組みを知る

先に結論を3行で。

  • 日本語で使うなら、迷う必要はほぼありません。large-v3-turbo が事実上の正解です。公式に「largeを最適化したもので、精度の低下を最小限に抑えつつ、より速い」と書かれています。
  • 容量が気になるなら量子化版を使います。当社の製品ではlarge-v3-turboの量子化版で約550MB。largeの2.9GiBと比べて5分の1以下です。
  • tinyやbaseに落とすのは筋が悪いです。日本語の固有名詞が目に見えて崩れるわりに、速さは「常駐させる」ほうがはるかに効きます。

Whisperを自分で動かすとき、最初に迷うのがモデル選びです。公式の数字を並べて、実務での選び方まで書きます。確認日:2026年8月17日。

公式のモデル表

OpenAIの公式リポジトリに載っている表です。

モデル パラメータ数 必要なVRAM 相対的な速さ
tiny 3,900万 約1GB 約10倍
base 7,400万 約1GB 約7倍
small 2億4,400万 約2GB 約4倍
medium 7億6,900万 約5GB 約2倍
large 15億5,000万 約10GB 1倍(基準)
turbo 8億900万 約6GB 約8倍

turboだけ、明らかに別格です。largeの半分ほどの大きさで、8倍速い。公式の説明はこうです。

turboモデルは large-v3 を最適化したもので、精度の低下を最小限に抑えつつ、より速い文字起こしを実現します。

もう少し中身を言うと、モデルカードにこう書かれています。

Whisper large-v3-turbo は、枝刈りした Whisper large-v3 を追加学習させたものです。言い換えると、デコードの層が32から4に減っているだけで、まったく同じモデルです。

「別物の小さいモデル」ではなく「largeの一部を削ったもの」という理解でよいです。だから精度がそれほど落ちません。

ディスクをどれだけ食うか

whisper.cppで配られているモデルファイルの実サイズです。

モデル ディスク
tiny 75MiB
base 142MiB
small 466MiB
medium 1.5GiB
large 2.9GiB

量子化でさらに小さくできる

量子化は、数値の細かさを落として軽くする加工です。同じモデルでも、ファイルがぐっと小さくなります。

当社の製品ではlarge-v3-turboの量子化版を使っていて、約550MBです。largeの2.9GiBと比べて5分の1以下。精度の落ち方は、日本語の実務では気になりませんでした。

「largeが良さそうだけど重い」で止まっている方は、まずturboの量子化版を試してみてください。ここが今のいちばん現実的な着地点です。

★大事なこと:速さはモデルでは決まらない

ここを外すと選び方を間違えます。当社が実際に測った数字です。

やり方 1回あたりの時間
コマンドを都度呼ぶ(毎回モデルを読み直す) 9.4秒
常駐させておく(読み込みっぱなしにする) 0.5〜0.8秒

測定環境は MacBook Air(Apple M5・メモリ24GB)、モデルはlarge-v3-turbo(547MB)です。

10倍以上の差があります。しかもこれはモデルを小さくしても埋まりません。読み込みにかかる時間なので、むしろモデルが大きいほど効いてきます。

つまり「遅いからtinyに落とす」より「常駐させる」ほうが、桁違いに効きます。順番を間違えないでください。くわしくはWhisperをローカルで動かす文字起こしに書きました。

用途別の選び方

用途 おすすめ 理由
日本語の音声入力・文字起こし large-v3-turbo(量子化版) 精度と速さと容量のつり合いがいちばん良い
とにかく精度を上げたい(時間は気にしない) large-v3 turboはデコードの層を削っているので、理屈のうえでは上限が高い
古い機種・メモリが少ない smallの量子化版 mediumは1.5GiBで重くなりがち
英語だけ・短い語だけ base / small 英語のみのモデル(.en付き)もあります
日本語で tiny / base おすすめしません 固有名詞が目に見えて崩れます。速さは常駐で稼ぐほうが得

Macで動かすときの追加の一手

Apple Siliconのmacなら、whisper.cppを使うとさらに速くなります。公式にこうあります。

Apple Siliconの端末では、エンコーダの推論をCore ML経由でApple Neural Engine(ANE)で実行できます。CPUのみの実行と比べて3倍以上の高速化になります。

効く順番をまとめると、こうなります。

  1. 常駐させる(9.4秒 → 0.5〜0.8秒)← 桁違い
  2. turboを選ぶ(largeの約8倍)
  3. Apple Neural Engineを使う(CPUのみと比べて3倍以上)
  4. 量子化する(容量が5分の1以下)

ライセンスの確認を忘れずに

Whisperは無料で商用にも使えますが、使うモデルごとに配布元の表記を確認してください。2026年8月17日時点で確認した範囲では、次のとおりでした。

配布元 ライセンス表記
OpenAIの公式リポジトリ(コードと重み) MIT
large-v3-turbo のモデルカード MIT
ggml形式の配布リポジトリ(whisper.cpp用) MIT
large-v3 のモデルカード Apache-2.0
large-v2 のモデルカード Apache-2.0

同じOpenAIの掲載でも、モデルによって表記が違います。turboを使うならMITですが、モデルを差し替えるときは必ず取り直してください。

自分で組まない場合

ロカオンはmacOS 26以降(Apple Silicon)のMacが必要で、Windowsには対応していません。ご購入後は、ライセンスの確認だけ1日1回・数十バイトの通信をします(音声や文字は送りません。つながらない日が続いても14日間は使え、過ぎても無料版として使えます)。

この記事の調べ方

  • モデル表とturboの説明、ライセンス(MIT)はOpenAIの公式リポジトリ(2026年8月17日確認)。引用は原文の訳です。
  • turboが「枝刈りしたlarge-v3の追加学習」であることはlarge-v3-turboのモデルカード(同日確認)。
  • ディスクサイズ、Apple Neural Engineで3倍以上はwhisper.cppの公式リポジトリ(同日確認)。
  • ライセンス表記は各配布元のメタデータを機械的に取得して確認しました(同日)。
  • 9.4秒/0.5〜0.8秒/量子化して約550MBは、当社が2026年8月に実機で測った値です。環境は MacBook Air(Apple M5・メモリ24GB)。他の環境で同じ数字になることを保証するものではありません。

本メディア「ロカオン研究室」は、ローカルで完結する音声入力アプリ「ロカオン」を開発する合同会社ヒバナが運営しています。他社製品も、当社製品と同じ物差しで確認して書きます。記事中の他社製品の権利は各社に帰属します。

神林瑛治の似顔絵

この記事を書いた人

神林 瑛治 かんばやし えいじ

合同会社ヒバナ 代表/ローカルで完結する音声入力アプリ「ロカオン」開発者

自分で音声入力アプリを開発しながら、このラボで各社の製品を同じ物差しで実測しています。ふだんの業務も毎日音声入力で回しています。

© 2026 合同会社ヒバナ