VOICE INPUT LAB

ロカオン研究室

音声入力アプリの比較・検証・使い方を、実測ベースで。

Whisperで文字起こしをする方法。何ができて、何ができないか

仕組みを知る

先に結論を3行で。

  • Whisper(ウィスパー)での文字起こしはやり方が3つあります。ブラウザで試す・OpenAIのAPIに投げる・自分のMacで動かす。違いは費用よりも「音声がどこへ行くか」と「手間」です。自分のMacで動かせば料金はかかりません。
  • 速さは、多くの人が心配するほどの問題になりません。当社の実機では10分の録音を文字にするのに約23秒(実時間の26倍)でした。ただしこれはApple M5のMacでの値です。世代が古いMacでは時間は伸びます。
  • 本当の問題は精度の癖のほうです。当社が2026年8月に測ったところ、固有名詞を先に渡しておくと正解率は47.2%から75.0%に上がりました。ただし4通り試して1度も直らなかった語があり、同じ設定でも喋る人が変わると結果が割れました。「登録すれば直る」ではありません。

この記事は、Whisperで文字起こしをするときに何ができて、何ができないかを、公式の記載と当社の実測値の両方でまとめたものです。確認日:2026年8月24日。

この記事は、ローカルで完結する音声入力アプリ「ロカオン」を開発する合同会社ヒバナが書いています。当社製品の話が出てくる箇所には、その都度「当社製品」と明記します。

Whisperとは何か(3行で)

WhisperはOpenAIが公開している音声認識のモデルです。公式リポジトリには「Whisperのコードとモデルの重みはMITライセンスで公開されています」と明記されていて、自分で動かすかぎり料金はかかりません。対応言語は99言語で、日本語も含まれます(large-v3のモデルカードの記載)。

もうひとつ、最初に分けておきたいことがあります。「文字起こし」と「音声入力」は別の作業だということです。

文字起こし 音声入力
入り口 録音済みの音声ファイル いま喋っている声
待てる時間 数分待ってよい 1秒待たされると使えない
出口 テキストファイル いま開いている画面のカーソル位置

同じWhisperを使っていても、求められる作りがまったく違います。この記事は前者(文字起こし)の話ですが、後者を探して来た方のために、最後に違いをもう一度書きます。

文字起こしのやり方は3つある

大きく3つです。費用よりも「音声がどこへ行くか」で選ぶのが実務的です。

やり方 費用 手間 音声の行き先 向いている人
ブラウザで試す(公開されている実演ページ) 無料 ほぼゼロ その運営者のサーバー まず1回試したい
OpenAIのAPIに投げる 1分あたり0.006ドル(whisper-1の場合) 少し要る(鍵の取得・呼び出し) OpenAI 本数が多い・手元の機械が非力
自分のMacで動かす 0円 いちばん要る(環境づくり) どこにも行かない 外に出せない音声を扱う

やり方1:ブラウザで試す(5分)

  1. Whisperを動かせる公開ページ(Hugging Faceの実演ページなど)を開く
  2. 音声ファイルを画面にドラッグする。マイクからその場で録音できるページもあります
  3. 実行して、出てきた文字をコピーする

入れるものは何もありません。ただし音声はその運営者のサーバーへ届きます。顧客名や社内の数字が入った音声では使わないでください。

やり方2:OpenAIのAPIに投げる(30分)

  1. OpenAIのアカウントを作り、支払い方法を登録して、APIの鍵を発行する
  2. 音声ファイルを25MB以下にする(下の「25MBの上限」を参照)
  3. 音声認識の窓口(/v1/audio/transcriptions)へ、モデル名と音声ファイルを送る
  4. 返ってきた文字を受け取る

プログラムを書かなくても、コマンド1行で送れます。1時間の会議1本でおよそ0.36ドル(whisper-1の場合)なので、費用が理由で止まることはほとんどありません。

やり方3:自分のMacで動かす(半日)

  1. Macで現実的な実装であるwhisper.cppを入れる
  2. モデルのファイルを1つ落とす(turboの軽量化版で約550MB)
  3. 音声ファイルを指定して実行する
  4. 短い音声を何度も処理するなら、常駐させる形にする(後述。ここを外すと「遅い」という結論になります)

手順の細部とつまずきどころはWhisperをローカルで動かす文字起こしに分けて書いてあります。音声がどこへも出ていかないのは、この3つめだけです。

APIには25MBの上限がある

見落としやすいのがここです。公式ドキュメントには「ファイルは25MBまで」と書かれています。対応形式はmp3・m4a・wav・webmなど(公式の案内ページとAPI仕様書で挙げている形式の数が違うので、使う形式は公式のページで確かめてください)。25MBを超える録音は圧縮するか、25MB以下に分割する必要があります。

そのうえで公式は、分割について「文の途中で分割することは避けてください。文脈が失われて精度が落ちます」と注意しています。長い会議録を機械的に等分すると、切れ目の前後だけ明らかに精度が落ちるのはこれが理由です。無音のところで切る道具を挟むのが定石になります。

3つのうち、どれを選ぶか

  • 1回きり・お試し:ブラウザで十分です。環境づくりの時間のほうが高くつきます
  • 本数が多い・自分の機械が非力:APIが素直です。1時間で0.36ドルなら、環境づくりの手間を買う価値があります
  • 顧客の名前が入っている・社外に出せない:自分のMacで動かす一択です。ここだけは費用ではなく条件の問題なので、他の2つでは代わりになりません

モデルの違い(turboとlarge-v3)

Whisperには大きさ違いのモデルがあります。公式リポジトリの表がこれです。

モデル パラメータ数 必要なVRAM 相対的な速さ
tiny 3,900万 約1GB 約10倍
base 7,400万 約1GB 約7倍
small 2億4,400万 約2GB 約4倍
medium 7億6,900万 約5GB 約2倍
large 15億5,000万 約10GB 1倍(基準)
turbo 8億900万 約6GB 約8倍

公式の説明では「turboはlarge-v3を最適化したもので、精度の低下を最小限に抑えつつ、より速い文字起こしができます」。モデルカードには、文章を組み立てる側の層を32から4に減らしたため「わずかな品質低下と引き換えに、はるかに速くなった」と書かれています。

当社は日本語でのモデル同士の精度比較を測っていませんので、ここでは「どれがいちばん精度が高いか」は書きません。分かっているのは、公式が「turboは速いかわりにわずかに品質が落ちる」と明言していることと、当社の製品ではturboの軽量化版(約550MB)を採用していることです。モデルごとの向き不向きの考え方はWhisperのモデルはどれを選ぶべきかにまとめました。

速さの話。当社の実測では10分が約23秒だった

「ローカルで動かすと遅いのでは」という心配をよく見ますが、数字で見ると印象が変わります。

当社の開発機(MacBook Air・Apple M5・メモリ24GB/turboの軽量化版)で測ると、10分の録音を文字にするのに22.9秒でした。実時間の26.2倍の速さです。1時間の録音なら2分20秒ほどの計算になります。

条件を2つ書いておきます。これはモデルを読み込み終わった状態(常駐)での認識時間で、読み込みの時間は含んでいません(後述のとおり、そこに約9秒かかります)。またApple M5という新しい機械での値です。当社製品の動作条件はApple Siliconの世代を問いませんが、世代が古いMacでは時間は伸びます。そこは実測していないので、数字は出しません。

では、なぜ「遅い」という声があるのか。速さの前に、作り方で差がつきます。

やり方 1回あたりの時間
コマンドを都度呼ぶ(毎回モデルを読み直す) 9.4秒
常駐させておく(サーバーとして立ち上げっぱなしにする) 0.5〜0.8秒

同じ環境での実測です。モデルを読み込む時間が毎回まるごと乗るので、短い音声を1回ずつ処理する使い方だと、9.4秒のうちほとんどが待ち時間になります。

用途によって、この差が問題になったりならなかったりします。

  • 録音ファイルをまとめて文字にするなら、都度呼ぶ形で構いません。読み込みの9秒は全体から見れば誤差です
  • 短い音声を何度も処理する(音声入力など)なら、常駐は必須です。ここを外すと「使えない」という結論になります

ここからが本題。Whisperにできないこと

当社が上位20件の見出しを数えたところ、「使い方」「インストール」「環境構築」のいずれかを掲げている記事が11件ありました。動かすところまでは、すでによく書かれています。実際に業務で使うと詰まるのは動かしたあとなので、当社が測った結果をそのまま出します。

測り方:8つの文(採点する語は18語)を用意し、Macの読み上げ音声2種類(Kyoko・Otoya)で読ませて、当社製品の認識エンジン(turboの軽量化版)に投げました。採点は18語が字面どおり出たかどうかだけで、助詞のゆれや句読点は数えていません。測定日は2026年8月23日です。

先に限界を書きます。声は人間ではなくMacの読み上げです。合成音声は発音がきれいすぎるので、人が喋ったときの数字とは変わります。下の数字は「読み上げ音声での結果」として読んでください。

その1:固有名詞は勝手には直らない

何も渡さない状態での正解率は47.2%(36語中17語)でした。半分以上が化けています。化け方はこうです。

言いたかった語 出てきた文字
ヒバナ(社名) 火花/ひばな
神林(人名) 上林
補償 保証
仕訳 仕分け
与信枠 予診枠

「補償」と「保証」、「仕訳」と「仕分け」のように、音が同じで意味が違う語が特に危ないと分かります。読み返しても目が滑るからです。当社が試したturboの軽量化版では、この種の取り違えが目立ちました。大きいモデルなら消えるのかどうかは、当社では測っていません。

その2:先に語を渡すと75.0%まで上がる。ただし残りは残る

Whisperには、あらかじめ「こういう言葉が出ますよ」と伝えておく仕組みがあります(この記事では以下「辞書」と呼びます)。日本語入力の単語登録のように確定で置き換わるものではなく、認識のたびにヒントとして渡すものだと考えてください。当社製品の「じぶん辞書」も、この仕組みの上に作っています。

18語(68字)を渡して測り直すと、正解率は75.0%(36語中27語)。27.8ポイントの改善です。それでも4語に1語は化けたままで、ここが「できないこと」の入口になります。

正解率 認識にかかった合計
辞書なし 47.2% 9.0秒
辞書あり(18語・68字) 75.0% 8.6秒

右の列は、渡しても遅くならなかったことを示しています(各1回の計測なので、0.4秒の差そのものは誤差の範囲として見てください)。速さを犠牲にせずに正解率が上がるので、固有名詞が多い仕事では最初にやる価値があります。

その3:辞書は長いほうが効くとは限らない

ここからが、あまり書かれていない話です。同じ語を渡しているのに、辞書が長いと効きませんでした。

辞書 与信枠 決裁
渡さない ✗ 予診枠 ✗ 決済/記載
18語・68字(全部入り) ✗ 予信枠 △ 声によって割れる
4語だけに絞る ○ 与信枠 ○ 決裁

68字でも「入れすぎ」でした。渡す語が増えるほど1語あたりの影響が薄まるためで、「登録する語は多いほどよい」ではありません。

実務での使い方としては、全部を登録するのではなく、その日・その案件で出てくる語だけを入れ替えるほうが当たります。なお当社製品では、一度に渡す量に上限(185字)を設けています。枠に入りきらない語は、認識したあとに文字を置き換える処理で拾うという作りです。

その4:どうやっても直らない語がある

「稟議書」は4通り試して、1度も正しく出ませんでした。

試したこと 結果
何も渡さない ✗ 倫義書・倫理書
18語68字の辞書に入れる ✗ 倫議書
4語に絞って入れる ✗ 倫議書
語ではなく文脈で入れる(「稟議書の決裁」) ✗ 倫理書

辞書は万能ではありません。こういう語は、認識したあとに文字を置き換える処理(後処理)で直すしかありません。「単語登録すれば直る」という前提で導入すると、ここで足をすくわれます。

その5:同じ辞書でも、喋る人が変わると結果が変わる

今回いちばん意外だったのがこれです。同じアプリ・同じ辞書・同じ台本でも、声を変えると結果が割れました。下の表は「実測」という語で試した結果です。

声 辞書なし 辞書あり
Kyoko ○ 実測 ○ 実測
Otoya ✗ 時速 ✗ 時速(渡しても直らない)

「渡邊」も同じ向きで割れました(辞書ありでKyokoは○、Otoyaは✗で「渡辺」)。

ここから言えるのは「他人のレビューは、あなたの結果を保証しない」ということです。導入を決めるときは、自分の機械で、自分の声で、自分がよく使う言葉で試す。この3つが揃っていない試し方だと、判断を間違えます。精度そのものの考え方は音声入力の精度は100点でなくてよいにも書きました。

そのほかの限界(先に知っておくと事故りません)

  • 無音のところで、ありもしない文が出ることがある。「ご視聴ありがとうございました」のような文が突然混ざるのがこれです。原因と対処はWhisperが無音で幻の文を出す理由にまとめました
  • 話しながら画面に文字が出ていく形(リアルタイム)には向いていない。Whisperは30秒のかたまりを前提に設計されているためです。公式にも「30秒の枠を滑らせながら処理する」と書かれています。詳しくはWhisperでリアルタイム文字起こしはできる?へ
  • 誰が喋ったかの区別(話者分離)は、そのままでは出ません。会議録で「Aさん:」「Bさん:」と分けたい場合、自分で動かすなら別の道具を組み合わせることになります。APIには話者を分ける専用のモデル(gpt-4o-transcribe-diarize)が用意されています
  • 句読点や表記のゆれは残ります。「10分」「十分」のような表記は揺れるので、あとから置き換える前提で運用するほうが早いです

「無料」の中身。ライセンスはモデルごとに違う

Whisperは無料ですが、「MITライセンスだから何でもできる」とまとめてしまうのは危ないので、ここは正確に書きます。同じOpenAIの掲載でも、モデルによって表記が違います。

どこ ライセンス表記
公式リポジトリ(コードとモデルの重み) MIT
large-v3-turbo のモデルカード MIT
large-v3 のモデルカード Apache-2.0

個人で文字起こしをするぶんには、どちらでも困りません。ただし自社の製品やサービスに組み込んで配る場合は、表記の義務が変わります。使うモデルを差し替えるときは、そのモデルの配布ページを自分で開いて取り直してください。まとめ記事の1行を信じないほうがいいところです(2026年8月24日時点で確認した内容です)。

よくある質問

Whisperの文字起こしは有料ですか

自分の機械で動かすなら無料です。コードもモデルの重みも公開されていて、ダウンロードにも利用にも料金はかかりません。有料になるのはOpenAIのAPIに投げるときで、2026年8月24日時点で1分あたり0.003〜0.006ドルです。「Whisperは有料」と書かれている場合、たいていAPIのほうの話をしています。

無料で何分までできますか

自分の機械で動かす場合、分数の上限はありません。制約になるのは時間と保存容量だけです。当社の実機(Apple M5・24GB)では10分の録音が22.9秒だったので、単純計算で1時間の録音なら2分20秒ほどです。

一方APIには25MBというファイルの上限がありますので、長い録音は圧縮するか分割することになります。これは分数ではなく容量の制限なので、音質を落とせば1本に入る時間は伸びます。

日本語の精度はどのくらいですか

当社が測ったのは固有名詞18語の字面だけなので、日本語全体の精度はこの記事では申し上げられません。分かっているのは、その18語について何も渡さないと47.2%、渡すと75.0%だったことです。数字は喋る人・録音環境・言葉の種類で大きく動きますので、他人の数字ではなく自分の音声で試してください。

録音した音声は外部に送られますか

やり方によります。自分の機械で動かす場合はどこにも送られません。APIに投げる場合とブラウザの実演ページを使う場合は、音声が相手のサーバーに届きます。顧客名や社内の数字が入った音声は、この違いが決定的です。考え方はクラウドに上げた音声はどこへ行くのかにまとめました。

WindowsやiPhoneでもできますか

Whisper自体はWindowsでも動きます(この記事の実測はMacのものです)。iPhoneについては、当社は測っていませんので、できる・できないは書きません。なお当社製品のロカオンはMac専用で、Windowsには対応していません。iPhone版は開発中です。

で、あなたに必要なのは文字起こしですか、音声入力ですか

最後にもう一度、入り口の話に戻ります。

  • 録音を、あとからまとめて文字にしたい → 文字起こしです。この記事の3つのやり方から選んでください。常駐は不要なので、環境づくりも軽くて済みます
  • 喋って、そのまま画面に文字を入れたい → 音声入力です。常駐させる・語を毎回渡す・上限を守るという作り込みが要ります

後者には、Whisperを使わない選択肢もあります。macOSには標準の音声入力があり、追加の費用はかかりません。まずはそちらを試して、固有名詞の化け方が我慢できる範囲なら、それで足ります。設定の勘所はMacの音声入力を実用にする設定に書きました。

標準機能で足りなかった方へ。当社製品であるロカオンは、ローカルで完結する音声入力アプリです。この記事で書いた落とし穴(都度読み込み・渡しすぎ・直らない語)を全部踏んだうえで作りました。turboの軽量化版(約550MB)を常駐させていて、人名や社名を登録する「じぶん辞書」があり、画面もメニューも日本語です。

当社が劣るところも先に書きます。

  • Windowsには対応していません。Windows中心の方は、この記事の3つのやり方か、他社のアプリを見てください
  • iPhone版は開発中です。現在はMac版のみ先行しています
  • 使い放題(1回10分まで)は有料です。macOS標準の音声入力は0円で回数の上限もないので、そこは勝てません。年払いで年6,600円(税込・月あたり550円)、月払いは月770円(税込)
  • その代わり1日10回まで(1回1分まで)は無料で使い続けられます。最初の10日間は回数の制限なし(1回10分まで)、クレジットカードの登録も要りません(無料のまま使い続けても、自動で課金される作りにはしていません)
  • 動作条件はmacOS 26以降(Apple Silicon)です

そして、この記事の「その5」で書いたとおりです。試すときは、必ず自分の声で、自分がよく使う言葉を喋ってみてください。当社の実測ですら、声が変わるだけで結果が割れています。

この記事の調べ方

  • Whisperのライセンス・モデル表・turboの説明・30秒の枠はOpenAIの公式リポジトリの記載(2026年8月24日確認)。引用文は原文のままです
  • 99言語・受容野30秒・Apache-2.0の表記はlarge-v3のモデルカード、MITの表記と層を32から4に減らした説明はlarge-v3-turboのモデルカード(同日確認)
  • 25MBの上限・分割時の注意・話者分離のモデル名はOpenAIの音声認識ガイド(同日確認)。対応形式は、この案内ページが7種類を挙げているのに対し、API仕様書ではflacとoggを含む9種類という記載も確認しました。食い違うので記事では代表的なものだけを挙げています、1分あたりの料金は公式の料金ページ(同日確認)。料金は変わります。導入前にご自身で確認してください
  • 上位20件の見出しの数え方:狙いキーワードでの検索上位20件について、タイトルと見出しに「使い方」「インストール」「環境構築」のいずれかを含むものを数えました(2026年8月24日時点・11件)
  • 10分=22.9秒(26.2倍速)、都度呼ぶと9.4秒/常駐なら0.5〜0.8秒は、当社が2026年8月に実機で測った値です。環境は MacBook Air(Apple M5・メモリ24GB)/large-v3-turboの軽量化版(約550MB)。認識にかかった時間で、モデルの読み込みは別勘定です。他の環境で同じ数字になることを保証するものではありません
  • 辞書の実測(47.2%→75.0%、68字と4語の差、稟議書が4通りとも×、Kyoko/Otoyaで結果が割れた件)は、当社が2026年8月23日に測った結果です。声は人間ではなくMacの読み上げ音声、採点は指定18語の字面のみ、各条件1回の計測。人が喋った場合の数字とは変わります

本メディア「ロカオン研究室」は、ローカルで完結する音声入力アプリ「ロカオン」を開発する合同会社ヒバナが運営しています。他社製品も、当社製品と同じ物差しで確認して書きます。記事中の他社製品の権利は各社に帰属します。

神林瑛治の似顔絵

この記事を書いた人

神林 瑛治 かんばやし えいじ

合同会社ヒバナ 代表/ローカルで完結する音声入力アプリ「ロカオン」開発者

自分で音声入力アプリを開発しながら、このラボで各社の製品を同じ物差しで実測しています。ふだんの業務も毎日音声入力で回しています。

© 2026 合同会社ヒバナ