VOICE INPUT LAB

ロカオン研究室

音声入力アプリの比較・検証・使い方を、実測ベースで。

Whisperでリアルタイム文字起こしはできる?遅延の正体と実用ライン

砂時計と区切られた音の波形とマイクを描いた手描き風イラスト 仕組みを知る

先に結論を3行で。

  • Whisperは30秒のかたまりを前提に設計されているため、そのままでは「話しながら文字が出る」用途に向いていません。これは実装の工夫ではなく、モデルの作りの話です。
  • それでも回避策はあります。公式のサンプルには0.5秒ごとに音を取り込んで文字起こしを回し続ける実時間モードがあり、長い話し声で3.3秒の遅れまで詰めた研究例もあります。
  • 音声入力として実用になるのは「話し終わってから1秒前後で出る」形です。当社の実測では常駐させれば0.5〜0.8秒。ここが現実的な着地点です。

「Whisper リアルタイム」で調べると、できるという記事とできないという記事の両方が出てきます。どちらも間違ってはいません。何をもってリアルタイムと呼ぶかで答えが変わるからです。順に切り分けます。確認日:2026年8月17日。

遅延の正体は「30秒」

Whisperのモデルカードには、はっきりこう書かれています。

Whisper has a receptive field of 30-seconds. To transcribe audios longer than this, one of two long-form algorithms are required
(Whisperの受容野は30秒です。これより長い音声を文字にするには、2つある長時間用のアルゴリズムのどちらかが必要です)

受容野30秒とは、「一度に30秒ぶんの音を見て考える作り」という意味です。ここから2つのことが起きます。

  • 短い音を渡しても、30秒ぶんに引き伸ばして処理される。足りないぶんは無音で埋められます。1秒だけ喋っても、モデルの中では30秒ぶんの計算が走ります。
  • 細かく切ると、語のつながりが切れる。かたまりをまたいだ単語が分断されたり、前後の文脈が失われて別の語になったりします。

つまり「細かく切って速くする」という素直な手が、そのままでは効かないという構造です。ここがリアルタイム化の難しさの正体です。

それでも回避されている ― 2つの現実解

① 0.5秒ごとに回し続ける(whisper.cppの実時間サンプル)

whisper.cppの公式リポジトリには実時間の音声入力サンプルが入っていて、その説明は「0.5秒ごとに音声を取り込み、文字起こしを連続して実行する」となっています。画面には文字が流れ続けるので、見た目はリアルタイムです。

ただし、直前に書いた「30秒に引き伸ばされる」問題は残ります。出た文字があとから書き換わる(前の推測が次の回で修正される)ことがあるので、確定した文章として扱うには一手間いります。

② 遅れを許容して精度を取る(whisper_streaming など)

研究として、区切りのない長い話し声に対して3.3秒の遅れで文字起こしする実装も公開されています。会議の字幕のように「3秒遅れてもいいから正確に」という用途なら、こちらが現実的です。

音声入力なら「話し終わってから」で十分

ここで用途を分けて考えるのが大事です。

用途 求められること Whisperで足りるか
音声入力(メール・チャット・資料を喋って書く) 話し終わってから、すぐ文字になる 十分。1秒前後で出る
会議の字幕(話している最中に読ませる) 話しながら、遅れずに出る △ 数秒の遅れと書き換わりを受け入れるなら
同時通訳のような用途 ほぼ遅れなし ✕ 別の仕組みが要る

実は、音声入力の用途では「話しながら出る」必要がありません。喋り終わって1秒で貼り付けば、体感としては十分に速いからです。市販の音声入力アプリの多くも、話し終わってからまとめて文字にする方式を採っています(話しながら出る「リアルタイムモード」を上位プランの機能として分けている製品もあります)。

★実用ラインを決めるのは、モデルではなく常駐

「話し終わってから1秒」を実現できるかどうかは、モデルの大きさよりも、モデルを読み込みっぱなしにしているかどうかで決まります。当社が測った数字です。

やり方 1回あたりの時間
コマンドを都度呼ぶ(毎回モデルを読み直す) 9.4秒
常駐させておく(サーバーとして立ち上げっぱなし) 0.5〜0.8秒

測定条件は、MacBook Air(Apple M5・メモリ24GB)、モデルはlarge-v3-turbo(547MB)です。10倍以上の差で、しかもこの差はモデルを小さくしても埋まりません(読み込みの時間なので、むしろモデルが大きいほど効いてきます)。

参考までに、当社が同じ環境で音声会話(聞き取り→考える→喋る)を丸ごと組んだときは、話し終わってから返事が聞こえるまで約1.5秒でした。文字起こしだけならその半分以下です。

速くしたいときに効く順番

  1. 常駐させる … 9.4秒 → 0.5〜0.8秒。ここが桁違いに効きます。他を触る前にこれ
  2. turboを使う … 公式表で「largeの約8倍の速さ、精度の低下は最小限」
  3. Apple Neural Engineを使う … whisper.cppの公式に「CPUのみと比べて3倍以上の高速化」とあります(Apple Siliconの場合)
  4. 量子化して軽くする … 当社製品ではlarge-v3-turboの量子化版で約550MB。largeの2.9GiBと比べて5分の1以下

逆に、いきなりtinyやbaseに落とすのは筋が悪いです。日本語の固有名詞が目に見えて崩れるわりに、常駐にするほどの効果は出ません。

結局どうするか

  • 自分で組む → whisper.cppの実時間サンプルから始めるのが早いです。MITライセンスで商用利用もできます。手順と落とし穴はWhisperをローカルで動かす文字起こしにまとめました。
  • 話しながら文字を出したい → その機能を持つ市販アプリを選ぶのが早いです。たとえばAqua Voiceは上位プランに「リアルタイムモード」があります(Aqua Voiceの料金は結局いくら?)。
  • 仕事の入力に使いたい・音声を外に出したくない → ローカルで完結する音声入力アプリロカオンがあります(当社製品です)。large-v3-turboの量子化版を常駐させていて、話し終わるとその場で文字が貼り付きます。音声も文字も端末の外に送らないので、電波の届かない場所でも動きます(ご購入後は、ライセンスの確認だけ1日1回・数十バイトの通信をします。音声や文字は送りません。つながらない日が続いても14日間は使え、過ぎても無料版として使えます)。年払いで年6,600円(月あたり550円・税込)です。1日10回まで(1回1分まで)なら無料で使え、最初の10日間は回数の制限もありません。

ロカオンは「話しながら文字が出る」形ではありません(話し終わってから貼り付ける方式です)。またmacOS 26以降(Apple Silicon)のMacが必要で、Windowsには対応していません。

この記事の調べ方

  • 「受容野30秒」と長時間用アルゴリズムの説明はWhisper large-v3のモデルカードの記載(2026年8月17日確認)。引用文は原文のままです。
  • 「0.5秒ごとに取り込んで連続実行」およびApple Neural Engineでの3倍以上の高速化はwhisper.cppの公式リポジトリ(同日確認)。
  • turboの速さと精度の説明はOpenAIの公式リポジトリ(同日確認)。
  • 3.3秒の遅れは、区切りのない長時間音声を対象にした公開実装(whisper_streaming)が示している値です。
  • 9.4秒/0.5〜0.8秒/音声会話で約1.5秒は、当社が2026年8月に実機で測った値です。環境は MacBook Air(Apple M5・メモリ24GB)/large-v3-turbo(547MB)。他の環境で同じ数字になることを保証するものではありません。

本メディア「ロカオン研究室」は、ローカルで完結する音声入力アプリ「ロカオン」を開発する合同会社ヒバナが運営しています。他社製品も、当社製品と同じ物差しで確認して書きます。記事中の他社製品の権利は各社に帰属します。

神林瑛治の似顔絵

この記事を書いた人

神林 瑛治 かんばやし えいじ

合同会社ヒバナ 代表/ローカルで完結する音声入力アプリ「ロカオン」開発者

自分で音声入力アプリを開発しながら、このラボで各社の製品を同じ物差しで実測しています。ふだんの業務も毎日音声入力で回しています。

© 2026 合同会社ヒバナ