先に結論を3行で。
- Whisper(ウィスパー)での文字起こしはやり方が3つあります。ブラウザで試す・OpenAIのAPIに投げる・自分のMacで動かす。違いは費用よりも「音声がどこへ行くか」と「手間」です。自分のMacで動かせば料金はかかりません。
- 速さは、多くの人が心配するほどの問題になりません。当社の実機では10分の録音を文字にするのに約23秒(実時間の26倍)でした。ただしこれはApple M5のMacでの値です。世代が古いMacでは時間は伸びます。
- 本当の問題は精度の癖のほうです。当社が2026年8月に測ったところ、固有名詞を先に渡しておくと正解率は47.2%から75.0%に上がりました。ただし4通り試して1度も直らなかった語があり、同じ設定でも喋る人が変わると結果が割れました。「登録すれば直る」ではありません。
この記事は、Whisperで文字起こしをするときに何ができて、何ができないかを、公式の記載と当社の実測値の両方でまとめたものです。確認日:2026年8月24日。
この記事は、ローカルで完結する音声入力アプリ「ロカオン」を開発する合同会社ヒバナが書いています。当社製品の話が出てくる箇所には、その都度「当社製品」と明記します。
Whisperとは何か(3行で)
WhisperはOpenAIが公開している音声認識のモデルです。公式リポジトリには「Whisperのコードとモデルの重みはMITライセンスで公開されています」と明記されていて、自分で動かすかぎり料金はかかりません。対応言語は99言語で、日本語も含まれます(large-v3のモデルカードの記載)。
もうひとつ、最初に分けておきたいことがあります。「文字起こし」と「音声入力」は別の作業だということです。
| 文字起こし | 音声入力 | |
|---|---|---|
| 入り口 | 録音済みの音声ファイル | いま喋っている声 |
| 待てる時間 | 数分待ってよい | 1秒待たされると使えない |
| 出口 | テキストファイル | いま開いている画面のカーソル位置 |
同じWhisperを使っていても、求められる作りがまったく違います。この記事は前者(文字起こし)の話ですが、後者を探して来た方のために、最後に違いをもう一度書きます。
文字起こしのやり方は3つある
大きく3つです。費用よりも「音声がどこへ行くか」で選ぶのが実務的です。
| やり方 | 費用 | 手間 | 音声の行き先 | 向いている人 |
|---|---|---|---|---|
| ブラウザで試す(公開されている実演ページ) | 無料 | ほぼゼロ | その運営者のサーバー | まず1回試したい |
| OpenAIのAPIに投げる | 1分あたり0.006ドル(whisper-1の場合) | 少し要る(鍵の取得・呼び出し) | OpenAI | 本数が多い・手元の機械が非力 |
| 自分のMacで動かす | 0円 | いちばん要る(環境づくり) | どこにも行かない | 外に出せない音声を扱う |
やり方1:ブラウザで試す(5分)
- Whisperを動かせる公開ページ(Hugging Faceの実演ページなど)を開く
- 音声ファイルを画面にドラッグする。マイクからその場で録音できるページもあります
- 実行して、出てきた文字をコピーする
入れるものは何もありません。ただし音声はその運営者のサーバーへ届きます。顧客名や社内の数字が入った音声では使わないでください。
やり方2:OpenAIのAPIに投げる(30分)
- OpenAIのアカウントを作り、支払い方法を登録して、APIの鍵を発行する
- 音声ファイルを25MB以下にする(下の「25MBの上限」を参照)
- 音声認識の窓口(
/v1/audio/transcriptions)へ、モデル名と音声ファイルを送る - 返ってきた文字を受け取る
プログラムを書かなくても、コマンド1行で送れます。1時間の会議1本でおよそ0.36ドル(whisper-1の場合)なので、費用が理由で止まることはほとんどありません。
やり方3:自分のMacで動かす(半日)
- Macで現実的な実装であるwhisper.cppを入れる
- モデルのファイルを1つ落とす(turboの軽量化版で約550MB)
- 音声ファイルを指定して実行する
- 短い音声を何度も処理するなら、常駐させる形にする(後述。ここを外すと「遅い」という結論になります)
手順の細部とつまずきどころはWhisperをローカルで動かす文字起こしに分けて書いてあります。音声がどこへも出ていかないのは、この3つめだけです。
APIには25MBの上限がある
見落としやすいのがここです。公式ドキュメントには「ファイルは25MBまで」と書かれています。対応形式はmp3・m4a・wav・webmなど(公式の案内ページとAPI仕様書で挙げている形式の数が違うので、使う形式は公式のページで確かめてください)。25MBを超える録音は圧縮するか、25MB以下に分割する必要があります。
そのうえで公式は、分割について「文の途中で分割することは避けてください。文脈が失われて精度が落ちます」と注意しています。長い会議録を機械的に等分すると、切れ目の前後だけ明らかに精度が落ちるのはこれが理由です。無音のところで切る道具を挟むのが定石になります。
3つのうち、どれを選ぶか
- 1回きり・お試し:ブラウザで十分です。環境づくりの時間のほうが高くつきます
- 本数が多い・自分の機械が非力:APIが素直です。1時間で0.36ドルなら、環境づくりの手間を買う価値があります
- 顧客の名前が入っている・社外に出せない:自分のMacで動かす一択です。ここだけは費用ではなく条件の問題なので、他の2つでは代わりになりません
モデルの違い(turboとlarge-v3)
Whisperには大きさ違いのモデルがあります。公式リポジトリの表がこれです。
| モデル | パラメータ数 | 必要なVRAM | 相対的な速さ |
|---|---|---|---|
| tiny | 3,900万 | 約1GB | 約10倍 |
| base | 7,400万 | 約1GB | 約7倍 |
| small | 2億4,400万 | 約2GB | 約4倍 |
| medium | 7億6,900万 | 約5GB | 約2倍 |
| large | 15億5,000万 | 約10GB | 1倍(基準) |
| turbo | 8億900万 | 約6GB | 約8倍 |
公式の説明では「turboはlarge-v3を最適化したもので、精度の低下を最小限に抑えつつ、より速い文字起こしができます」。モデルカードには、文章を組み立てる側の層を32から4に減らしたため「わずかな品質低下と引き換えに、はるかに速くなった」と書かれています。
当社は日本語でのモデル同士の精度比較を測っていませんので、ここでは「どれがいちばん精度が高いか」は書きません。分かっているのは、公式が「turboは速いかわりにわずかに品質が落ちる」と明言していることと、当社の製品ではturboの軽量化版(約550MB)を採用していることです。モデルごとの向き不向きの考え方はWhisperのモデルはどれを選ぶべきかにまとめました。
速さの話。当社の実測では10分が約23秒だった
「ローカルで動かすと遅いのでは」という心配をよく見ますが、数字で見ると印象が変わります。
当社の開発機(MacBook Air・Apple M5・メモリ24GB/turboの軽量化版)で測ると、10分の録音を文字にするのに22.9秒でした。実時間の26.2倍の速さです。1時間の録音なら2分20秒ほどの計算になります。
条件を2つ書いておきます。これはモデルを読み込み終わった状態(常駐)での認識時間で、読み込みの時間は含んでいません(後述のとおり、そこに約9秒かかります)。またApple M5という新しい機械での値です。当社製品の動作条件はApple Siliconの世代を問いませんが、世代が古いMacでは時間は伸びます。そこは実測していないので、数字は出しません。
では、なぜ「遅い」という声があるのか。速さの前に、作り方で差がつきます。
| やり方 | 1回あたりの時間 |
|---|---|
| コマンドを都度呼ぶ(毎回モデルを読み直す) | 9.4秒 |
| 常駐させておく(サーバーとして立ち上げっぱなしにする) | 0.5〜0.8秒 |
同じ環境での実測です。モデルを読み込む時間が毎回まるごと乗るので、短い音声を1回ずつ処理する使い方だと、9.4秒のうちほとんどが待ち時間になります。
用途によって、この差が問題になったりならなかったりします。
- 録音ファイルをまとめて文字にするなら、都度呼ぶ形で構いません。読み込みの9秒は全体から見れば誤差です
- 短い音声を何度も処理する(音声入力など)なら、常駐は必須です。ここを外すと「使えない」という結論になります
ここからが本題。Whisperにできないこと
当社が上位20件の見出しを数えたところ、「使い方」「インストール」「環境構築」のいずれかを掲げている記事が11件ありました。動かすところまでは、すでによく書かれています。実際に業務で使うと詰まるのは動かしたあとなので、当社が測った結果をそのまま出します。
測り方:8つの文(採点する語は18語)を用意し、Macの読み上げ音声2種類(Kyoko・Otoya)で読ませて、当社製品の認識エンジン(turboの軽量化版)に投げました。採点は18語が字面どおり出たかどうかだけで、助詞のゆれや句読点は数えていません。測定日は2026年8月23日です。
先に限界を書きます。声は人間ではなくMacの読み上げです。合成音声は発音がきれいすぎるので、人が喋ったときの数字とは変わります。下の数字は「読み上げ音声での結果」として読んでください。
その1:固有名詞は勝手には直らない
何も渡さない状態での正解率は47.2%(36語中17語)でした。半分以上が化けています。化け方はこうです。
| 言いたかった語 | 出てきた文字 |
|---|---|
| ヒバナ(社名) | 火花/ひばな |
| 神林(人名) | 上林 |
| 補償 | 保証 |
| 仕訳 | 仕分け |
| 与信枠 | 予診枠 |
「補償」と「保証」、「仕訳」と「仕分け」のように、音が同じで意味が違う語が特に危ないと分かります。読み返しても目が滑るからです。当社が試したturboの軽量化版では、この種の取り違えが目立ちました。大きいモデルなら消えるのかどうかは、当社では測っていません。
その2:先に語を渡すと75.0%まで上がる。ただし残りは残る
Whisperには、あらかじめ「こういう言葉が出ますよ」と伝えておく仕組みがあります(この記事では以下「辞書」と呼びます)。日本語入力の単語登録のように確定で置き換わるものではなく、認識のたびにヒントとして渡すものだと考えてください。当社製品の「じぶん辞書」も、この仕組みの上に作っています。
18語(68字)を渡して測り直すと、正解率は75.0%(36語中27語)。27.8ポイントの改善です。それでも4語に1語は化けたままで、ここが「できないこと」の入口になります。
| 正解率 | 認識にかかった合計 | |
|---|---|---|
| 辞書なし | 47.2% | 9.0秒 |
| 辞書あり(18語・68字) | 75.0% | 8.6秒 |
右の列は、渡しても遅くならなかったことを示しています(各1回の計測なので、0.4秒の差そのものは誤差の範囲として見てください)。速さを犠牲にせずに正解率が上がるので、固有名詞が多い仕事では最初にやる価値があります。
その3:辞書は長いほうが効くとは限らない
ここからが、あまり書かれていない話です。同じ語を渡しているのに、辞書が長いと効きませんでした。
| 辞書 | 与信枠 | 決裁 |
|---|---|---|
| 渡さない | ✗ 予診枠 | ✗ 決済/記載 |
| 18語・68字(全部入り) | ✗ 予信枠 | △ 声によって割れる |
| 4語だけに絞る | ○ 与信枠 | ○ 決裁 |
68字でも「入れすぎ」でした。渡す語が増えるほど1語あたりの影響が薄まるためで、「登録する語は多いほどよい」ではありません。
実務での使い方としては、全部を登録するのではなく、その日・その案件で出てくる語だけを入れ替えるほうが当たります。なお当社製品では、一度に渡す量に上限(185字)を設けています。枠に入りきらない語は、認識したあとに文字を置き換える処理で拾うという作りです。
その4:どうやっても直らない語がある
「稟議書」は4通り試して、1度も正しく出ませんでした。
| 試したこと | 結果 |
|---|---|
| 何も渡さない | ✗ 倫義書・倫理書 |
| 18語68字の辞書に入れる | ✗ 倫議書 |
| 4語に絞って入れる | ✗ 倫議書 |
| 語ではなく文脈で入れる(「稟議書の決裁」) | ✗ 倫理書 |
辞書は万能ではありません。こういう語は、認識したあとに文字を置き換える処理(後処理)で直すしかありません。「単語登録すれば直る」という前提で導入すると、ここで足をすくわれます。
その5:同じ辞書でも、喋る人が変わると結果が変わる
今回いちばん意外だったのがこれです。同じアプリ・同じ辞書・同じ台本でも、声を変えると結果が割れました。下の表は「実測」という語で試した結果です。
| 声 | 辞書なし | 辞書あり |
|---|---|---|
| Kyoko | ○ 実測 | ○ 実測 |
| Otoya | ✗ 時速 | ✗ 時速(渡しても直らない) |
「渡邊」も同じ向きで割れました(辞書ありでKyokoは○、Otoyaは✗で「渡辺」)。
ここから言えるのは「他人のレビューは、あなたの結果を保証しない」ということです。導入を決めるときは、自分の機械で、自分の声で、自分がよく使う言葉で試す。この3つが揃っていない試し方だと、判断を間違えます。精度そのものの考え方は音声入力の精度は100点でなくてよいにも書きました。
そのほかの限界(先に知っておくと事故りません)
- 無音のところで、ありもしない文が出ることがある。「ご視聴ありがとうございました」のような文が突然混ざるのがこれです。原因と対処はWhisperが無音で幻の文を出す理由にまとめました
- 話しながら画面に文字が出ていく形(リアルタイム)には向いていない。Whisperは30秒のかたまりを前提に設計されているためです。公式にも「30秒の枠を滑らせながら処理する」と書かれています。詳しくはWhisperでリアルタイム文字起こしはできる?へ
- 誰が喋ったかの区別(話者分離)は、そのままでは出ません。会議録で「Aさん:」「Bさん:」と分けたい場合、自分で動かすなら別の道具を組み合わせることになります。APIには話者を分ける専用のモデル(gpt-4o-transcribe-diarize)が用意されています
- 句読点や表記のゆれは残ります。「10分」「十分」のような表記は揺れるので、あとから置き換える前提で運用するほうが早いです
「無料」の中身。ライセンスはモデルごとに違う
Whisperは無料ですが、「MITライセンスだから何でもできる」とまとめてしまうのは危ないので、ここは正確に書きます。同じOpenAIの掲載でも、モデルによって表記が違います。
| どこ | ライセンス表記 |
|---|---|
| 公式リポジトリ(コードとモデルの重み) | MIT |
| large-v3-turbo のモデルカード | MIT |
| large-v3 のモデルカード | Apache-2.0 |
個人で文字起こしをするぶんには、どちらでも困りません。ただし自社の製品やサービスに組み込んで配る場合は、表記の義務が変わります。使うモデルを差し替えるときは、そのモデルの配布ページを自分で開いて取り直してください。まとめ記事の1行を信じないほうがいいところです(2026年8月24日時点で確認した内容です)。
よくある質問
Whisperの文字起こしは有料ですか
自分の機械で動かすなら無料です。コードもモデルの重みも公開されていて、ダウンロードにも利用にも料金はかかりません。有料になるのはOpenAIのAPIに投げるときで、2026年8月24日時点で1分あたり0.003〜0.006ドルです。「Whisperは有料」と書かれている場合、たいていAPIのほうの話をしています。
無料で何分までできますか
自分の機械で動かす場合、分数の上限はありません。制約になるのは時間と保存容量だけです。当社の実機(Apple M5・24GB)では10分の録音が22.9秒だったので、単純計算で1時間の録音なら2分20秒ほどです。
一方APIには25MBというファイルの上限がありますので、長い録音は圧縮するか分割することになります。これは分数ではなく容量の制限なので、音質を落とせば1本に入る時間は伸びます。
日本語の精度はどのくらいですか
当社が測ったのは固有名詞18語の字面だけなので、日本語全体の精度はこの記事では申し上げられません。分かっているのは、その18語について何も渡さないと47.2%、渡すと75.0%だったことです。数字は喋る人・録音環境・言葉の種類で大きく動きますので、他人の数字ではなく自分の音声で試してください。
録音した音声は外部に送られますか
やり方によります。自分の機械で動かす場合はどこにも送られません。APIに投げる場合とブラウザの実演ページを使う場合は、音声が相手のサーバーに届きます。顧客名や社内の数字が入った音声は、この違いが決定的です。考え方はクラウドに上げた音声はどこへ行くのかにまとめました。
WindowsやiPhoneでもできますか
Whisper自体はWindowsでも動きます(この記事の実測はMacのものです)。iPhoneについては、当社は測っていませんので、できる・できないは書きません。なお当社製品のロカオンはMac専用で、Windowsには対応していません。iPhone版は開発中です。
で、あなたに必要なのは文字起こしですか、音声入力ですか
最後にもう一度、入り口の話に戻ります。
- 録音を、あとからまとめて文字にしたい → 文字起こしです。この記事の3つのやり方から選んでください。常駐は不要なので、環境づくりも軽くて済みます
- 喋って、そのまま画面に文字を入れたい → 音声入力です。常駐させる・語を毎回渡す・上限を守るという作り込みが要ります
後者には、Whisperを使わない選択肢もあります。macOSには標準の音声入力があり、追加の費用はかかりません。まずはそちらを試して、固有名詞の化け方が我慢できる範囲なら、それで足ります。設定の勘所はMacの音声入力を実用にする設定に書きました。
標準機能で足りなかった方へ。当社製品であるロカオンは、ローカルで完結する音声入力アプリです。この記事で書いた落とし穴(都度読み込み・渡しすぎ・直らない語)を全部踏んだうえで作りました。turboの軽量化版(約550MB)を常駐させていて、人名や社名を登録する「じぶん辞書」があり、画面もメニューも日本語です。
当社が劣るところも先に書きます。
- Windowsには対応していません。Windows中心の方は、この記事の3つのやり方か、他社のアプリを見てください
- iPhone版は開発中です。現在はMac版のみ先行しています
- 使い放題(1回10分まで)は有料です。macOS標準の音声入力は0円で回数の上限もないので、そこは勝てません。年払いで年6,600円(税込・月あたり550円)、月払いは月770円(税込)
- その代わり1日10回まで(1回1分まで)は無料で使い続けられます。最初の10日間は回数の制限なし(1回10分まで)、クレジットカードの登録も要りません(無料のまま使い続けても、自動で課金される作りにはしていません)
- 動作条件はmacOS 26以降(Apple Silicon)です
そして、この記事の「その5」で書いたとおりです。試すときは、必ず自分の声で、自分がよく使う言葉を喋ってみてください。当社の実測ですら、声が変わるだけで結果が割れています。
この記事の調べ方
- Whisperのライセンス・モデル表・turboの説明・30秒の枠はOpenAIの公式リポジトリの記載(2026年8月24日確認)。引用文は原文のままです
- 99言語・受容野30秒・Apache-2.0の表記はlarge-v3のモデルカード、MITの表記と層を32から4に減らした説明はlarge-v3-turboのモデルカード(同日確認)
- 25MBの上限・分割時の注意・話者分離のモデル名はOpenAIの音声認識ガイド(同日確認)。対応形式は、この案内ページが7種類を挙げているのに対し、API仕様書ではflacとoggを含む9種類という記載も確認しました。食い違うので記事では代表的なものだけを挙げています、1分あたりの料金は公式の料金ページ(同日確認)。料金は変わります。導入前にご自身で確認してください
- 上位20件の見出しの数え方:狙いキーワードでの検索上位20件について、タイトルと見出しに「使い方」「インストール」「環境構築」のいずれかを含むものを数えました(2026年8月24日時点・11件)
- 10分=22.9秒(26.2倍速)、都度呼ぶと9.4秒/常駐なら0.5〜0.8秒は、当社が2026年8月に実機で測った値です。環境は MacBook Air(Apple M5・メモリ24GB)/large-v3-turboの軽量化版(約550MB)。認識にかかった時間で、モデルの読み込みは別勘定です。他の環境で同じ数字になることを保証するものではありません
- 辞書の実測(47.2%→75.0%、68字と4語の差、稟議書が4通りとも×、Kyoko/Otoyaで結果が割れた件)は、当社が2026年8月23日に測った結果です。声は人間ではなくMacの読み上げ音声、採点は指定18語の字面のみ、各条件1回の計測。人が喋った場合の数字とは変わります
本メディア「ロカオン研究室」は、ローカルで完結する音声入力アプリ「ロカオン」を開発する合同会社ヒバナが運営しています。他社製品も、当社製品と同じ物差しで確認して書きます。記事中の他社製品の権利は各社に帰属します。

