先に結論を3行で。
- 固有名詞が化けるのは、マイクのせいとはかぎりません。当社の実測では、音声はそのままで「使う言葉を先に教える」だけで直りました。
- ただし言葉を教えれば必ず効く、というものでもありません。長すぎる/渡す場所が違う/無音で切られているの3つで、教えたはずの言葉がまるごと無効になります。3つとも当社の実測で示します。
- マイクや録り方も効きますが、Googleの公式は「ノイズ低減処理はすべて無効にする」と書いています。良かれと思って足したものが裏目に出ることがあります。
「音声入力 精度」で調べると、マイクを替える・静かな場所で・はっきり話す——という助言がよく出てきます。どれも間違いではありません。ただ、仕事の文章で本当に困るのは、人名・社名・商品名・専門用語が化けることで、そこはマイクを替えても直らないことが多いのです。この記事では、当社が音声入力アプリを作りながら実際に測った数字を中心に、効く順に並べます。確認日:2026年8月22日。
そもそも「精度」とは何を指しているのか
各社が言う「精度99%」の中身は、ワードエラー率(WER)という物差しであることがほとんどです。Google Cloudの公式ドキュメントには、こう書かれています。
WER は、発生の可能性がある次の 3 種類の音声文字変換エラーの組み合わせです。挿入エラー(I): 仮説の文字起こしにあり、グラウンド トゥルースにはない単語。置換エラー(S): 仮説の文字起こしとグラウンド トゥルースの両方に存在するが、正しく文字起こしされていない単語。削除エラー(D): 仮説の文字起こしにはないが、グラウンド トゥルースにはある単語。
ここで大事なのは、WERは単語を1つずつ数える物差しで、「どの単語を間違えたか」の重みを見ていないということです。「えー」が1つ余分に入るのも、お客様の社名を間違えるのも、数字の上では同じ1つです。
ところが仕事では、この2つはまったく違います。「えー」は読めば分かる。社名の間違いはそのまま送ると事故になる。だから「精度を上げる」を、WERを下げることではなく「固有名詞を落とさないこと」だと読み替えるほうが、実務では近道です。以下はその前提で並べています。
手① 精度を上げる最短ルートは「使う言葉を先に教える」
いまの音声認識は、認識を始める前に「こういう言葉が出てきます」と渡せる作りになっているものが多くあります。OpenAIの公式ドキュメントでは、文字起こしの prompt という項目がこう説明されています。
improve recognition of names, acronyms, formatting, or recording-specific vocabulary
(名前・略語・書式・その録音に特有の語彙の認識をよくする)
用途としてこう並んでいます。
- Correctly transcribing product names, technical terms, and acronyms(商品名・専門用語・略語を正しく文字にする)
- Carrying context from a previous chunk of a longer recording(長い録音で、前の区切りの文脈を引き継ぐ)
- Preserving punctuation, capitalization, and filler words(句読点・大文字小文字・言いよどみを残す)
ひとつ注意があります。ここで渡すのは命令ではなく「こういう言葉が出ます」という手がかりです。OpenAIの公式にも「Whisper doesn’t follow instructions like a general-purpose text model(Whisperは汎用のテキストモデルのようには指示に従いません)」と書かれています。「固有名詞は正確に書き起こして」と書いても効きません。語そのものを並べてください。
製品によって呼び名は「辞書」「単語登録」「用語集」「カスタム語彙」などバラバラですが、やっていることはだいたい同じです。Googleも公式ドキュメントで、精度の調整手段として「Speech Adaptation API」の利用を挙げています。
まずここに手を付けてください。マイクを買い替えるより先です。理由は次の章の実測が示します。
手①のつまずき:辞書を入れても効かないときに疑う3か所(当社の実測)
ここからが、他ではあまり書かれていないところです。当社はローカルで完結する音声入力アプリロカオン(当社製品です)を作っており、その開発中に「辞書を入れたのに直らない」という現象を3回、別々の原因で踏みました。以下はそのときの実測です。
測り方:Mac(Apple Silicon)で Whisper の large-v3-turbo をローカルに常駐させ、同じ音声ファイルを繰り返し読ませて、条件を1つだけ変えて結果を比べました(2026年8月16日)。読ませた文には、当社が普段よく落とす固有名詞(社名・人名・工具名)を入れてあります。「全問正解」は、その音声に入れておいた固有名詞がすべて正しく出た、という意味です。試行の回数までは記録に残していないので、統計的な検証ではなく、開発中に上限を決めるために測ったものとお読みください。
疑う1:辞書が長すぎる
辞書は長いほど効くと思いがちですが、逆でした。辞書の長さだけを変えて、同じ音声を読ませた結果です。
| 渡した辞書の長さ | 結果 |
|---|---|
| 142字 | 全問正解 |
| 187字 | 全問正解 |
| 221字 | 「神林」が「カンバヤシ」に劣化 |
| 271字 | 「カナトコ」が「金床」に劣化 |
長くしたせいで、短いときは正解していた語まで落ちました。原因は、渡せる長さに上限があるからです。OpenAIの公式ドキュメントにも、Whisper系のモデルについてこう書かれています。
prompts have a 224-token limit
(プロンプトには224トークンの上限があります)
トークンは文字数とは違う単位です。日本語が何文字ぶんに当たるかは公式には示されていませんので、ここは当社の実測に頼るしかありませんでした。上の表のとおり187字までは全問正解、221字から崩れ始めたので、当社は余裕をみて185字(およそ40語)を上限と決めています。それを超える語は、次に書く別の方法で処理します。
なお、この224トークンという上限は Whisper 系のモデルの話です。OpenAI は現在、文字起こしには別のモデルを推奨しており、そちらでは渡し方も上限も変わります。ご自身の道具が何を使っているかで、この数字は変わります。共通して言えるのは「渡せる長さには上限があり、超えると効きが落ちる」ところまでです。
ここから言えること:辞書に100語も200語も登録している方は、いま効いているのは最初の数十語だけかもしれません。語を減らすと精度が上がることがあります。
疑う2:辞書を渡す場所が違う
2つめは、同じ辞書でも「いつ渡すか」で効いたり効かなかったりしたという話です。
当社は最初、認識エンジンを起動するときにまとめて辞書を渡していました。これがまったく反映されませんでした。録音1回ごとに毎回渡す形に変えたところ、同じ辞書のまま「カナトコ」「神林」が一発で正解に変わりました。
これは当社が使っている実装での話で、すべての製品に当てはまるとは言いません。ただ設定画面で辞書を登録したのに効かないとき、「登録したあと、いつ反映されるのか」を疑う価値はあります。設定を変えたあとにアプリを立ち上げ直したら直った、という経験のある方は、同じことが起きていたのかもしれません(他社製品の中身は公開されていないため、断定はできません)。
実際、当社は前回の認識エンジンが裏に残っていると、古い辞書を握ったまま動き続けることも実測しました。いまは起動のたびに古いものを片付けてから始めています。
疑う3:無音で音声が切られている
3つめがいちばん見つけにくいものでした。
音声認識には「無音の自動検出(VAD)」という仕組みがよく入っています。黙っているところを捨てて、しゃべっているところだけを認識に回す機能で、速さと無駄の削減には効きます。
ところが当社の実測では、これを入れると、2つ目以降の区切りに辞書が渡っていませんでした。症状はこうです。
- ひと息で短く言うと正しく出る
- 途中で少し黙ってから続けると、その後半だけ固有名詞が化ける
- 実例:「俯瞰図」が「武漢図」になった。無音の自動検出を切ると、同じ音声で一発で正解
「長く話すと後半だけ精度が落ちる」と感じている方は、ほぼこれです。使う側でできる対処は、大事な固有名詞を、長い黙りのあとに置かないこと。作る側でできる対処は、無音の自動検出を切ることです(当社はそうしました。そのぶん静かなところで幻の言葉が出やすくなるので、別の後処理で落としています)。
手② 枠に入りきらない言葉は「後から直す」
前章のとおり、先に教えられる語には上限があります。では、それ以上の語はあきらめるのか。あきらめなくて済みます。方法が2つあります。
- 認識したあとで置き換える……「わたなべ」と出たら「渡邊」に直す、というただの置換表です。認識エンジンの上限とは無関係なので、何百語でも登録できます。当社はこの2階建て(先に教える185字+後から直す置換表)にしています
- いま画面に出ている言葉を、その場で足す……見ている書類や画面に出ている固有名詞を、その録音のときだけ先に教える。当社は先ほどの185字の枠の内側に、画面から拾った語の席を最大40字ぶん取っています(読み取った内容は、保存も送信もしません)
ご自身の道具に置換の機能があるなら、よく落ちる語は全部そちらへ回すのが正解です。先に教える枠は、本当に落とせない語だけの席と考えてください。
手③ マイクと録り方で精度を上げる(ただし足しすぎない)
ここでようやくマイクの話です。Google Cloudの公式ドキュメントが挙げている条件は、次のとおりです。
| 公式が書いていること | やること |
|---|---|
| 「16,000 Hz 以上のサンプリング レートで音声をキャプチャします。」 | 録音の設定を落とさない |
| 「可能な限りユーザーの近くにマイクを置いてください。」 | マイク周りではいちばん効く。ノートPCの内蔵マイクでも、顔を近づければ変わる |
| 「音声の録音と転送にはロスレス コーデックを使用します。」「再サンプリングは避けます。」 | いったん圧縮した音声を後から認識に回さない |
| 「認識機能は、ノイズキャンセリングを追加することなく、背景の音声やノイズを無視するように作られています。」 | ノイズ除去を自分で足さない |
最後の1行に驚かれるかもしれません。「雑音対策としてノイズ除去を入れる」は、公式には推奨されていません。同じページの音声の前処理の項には、さらにはっきりと「すべてのノイズ低減処理を無効にする必要があります。」と書かれています。理由までは書かれていませんが、認識に回す前に自分で音を加工するのは、良かれと思ってやっても裏目に出ることがあるということです。会議アプリの音声強調を入れたまま認識させて結果が落ちる、というのは起こりえます。
まとめると、マイクでやることは「近づける」だけでほぼ足ります。高いマイクを買う前に、置き場所を10cm変えてみてください。
手④ 話し方は「区切りすぎない」
「はっきり、ゆっくり」はよく言われますが、当社の実感は少し違います。ゆっくりよりも、区切らないほうが効きます。
いまの認識は前後の文脈から言葉を決めています。単語だけを切り出して言うと、その手がかりが無くなります。「カナトコ」だけを単独で言うと落ちるのに、「カナトコで叩いて成形します」と続けて言うと通る、ということが起きます。
- 単語だけを言わない。短くていいので文にする
- 途中で長く黙らない(前章の「疑う3」の理由)
- 言い直しはその場で言い直してよい。後でAIに整えさせる前提なら、多少の重複は問題になりません
手⑤ 認識モデルを替える(精度には効くが、最後でよい)
自分で認識エンジンを選べる場合は、モデルの大きさで精度が変わります。ただし大きいほど良い、という単純な話ではありません。日本語での選び方はWhisperのモデルはどれを選ぶ?にまとめました(結論だけ書くと、日本語なら large-v3-turbo でほぼ足ります)。
また、静かなところで身に覚えのない文が入るのは精度の問題ではなく別の現象です。原因と対処はWhisperで「ご視聴ありがとうございました」が勝手に入る理由に分けて書きました。
Macの標準機能でどこまでいけるかはMacの音声入力を実用にする設定にあります。お金をかけずに手①を試したい方は、Macの標準機能でもできます。ただし場所が分かりにくいので、正確に書いておきます。
- キーボード設定にあるふつうの「音声入力」には、単語を登録する仕組みがありません
- 一方、アクセシビリティの「音声コントロール」には「用語集」があります。Appleの公式ガイドには「最大1000個の用語集の項目を追加して、それらの言い方を音声コントロールに教えることができます。」と書かれています
- そして音声コントロールをオンにすると、文字入力もそちらが担当します(Appleの公式ガイドに、音声コントロールがオンのときは標準の音声入力は使えない旨の記載があります)
つまりMacだけで、1000語まで登録して音声入力する道はあります。設定場所は「システム設定 → アクセシビリティ → 音声コントロール → 用語集」です。当社製品を勧める前に、まずここを試していただくのが順序として正しいと考えています。
それでも100点にはなりません
正直に書きます。ここまで全部やっても、100点にはなりません。当社の製品でもなりません。
ただ、100点でなくても仕事は回ります。音声入力を「清書の道具」ではなく「AIに渡す材料を作る道具」と考えると、必要な精度がぐっと下がります。その考え方は音声入力の精度は100点でなくていいに書きました。ただし、AIにも直せないものがあります。それが固有名詞です。だからこそ、この記事の手①〜②に手を掛ける価値があります。
道具の側で選ぶなら
ここまでの内容は、どの製品を使っていても効きます。そのうえで、道具を選び直す場合の見どころを挙げます。
- 自分で語を登録できるか(できない製品では手①が使えません)
- 登録した語がいつ反映されるか、何語まで効くかが書いてあるか
- 認識のあとで置き換える機能があるか(上限の外側を救えます)
- 音声がどこで処理されるか(社外に出せない話をするなら、ここが先に効きます)
当社のローカルで完結する音声入力アプリロカオン(当社製品です)は、この記事に書いた形をそのまま実装しています。先に教えるのが185字(約40語)まで、それを超える語は「よみ=表記」の置換で直す2階建てです。画面に出ている言葉をその録音のときだけ足す機能もあります。音声も文字も端末の外に送りません(ご購入後の通信はライセンスの確認だけで、1日1回・数十バイトです。つながらない日が続いても14日間は使え、過ぎても無料版として使えます)。料金は年払いが年6,600円(税込・月あたり550円)、月払いが月770円(税込)です。1日10回まで(1回1分まで)なら無料で使え、最初の10日間は回数の制限もありません。
制約もはっきり書いておきます。macOS 26以降(Apple Silicon)が必要で、Windowsには対応していません。現在ご提供しているのはMac版のみで、iPhone版は開発中です。Windowsでも使いたい方には、この記事のやり方をご自身の道具で実践していただくほうが早いです。
この記事の調べ方
- ワードエラー率(WER)の定義と、精度の調整手段(モデル選択・Speech Adaptation API)は、Google Cloud「音声の精度を測定して改善する」の記載(2026年8月22日確認)。引用は原文のままです。
- 録音条件(16,000 Hz以上・マイクは近く・ロスレス・再サンプリングを避ける・ノイズキャンセリングを追加しない)は、Google Cloud「Speech-to-Text のベスト プラクティス」の記載(同日確認)。引用は原文のままです。
- プロンプトの用途と「224トークンの上限」「Whisperは汎用の文章モデルのようには指示に従わない」は、OpenAI「Speech to text」の記載(同日確認)。訳は当社によるものです。
- 142字/187字/221字/271字の結果、起動時と録音ごとの違い、無音の自動検出で「俯瞰図」が「武漢図」になった件は、すべて当社が2026年8月16日にMac(Apple Silicon)+Whisper large-v3-turbo で実測した結果です。他社製品を測ったものではなく、他の認識エンジンで同じことが起きるとはかぎりません。
- Macの音声コントロールの用語集(最大1000個・音声コントロールがオンのときは標準の音声入力は使えない)は、AppleのMacユーザガイド「Macの音声コントロールでカスタム用語集を使用する」および同「Dictate messages and documents on Mac」の記載(2026年8月22日確認)。
- 他社製品が語をどう扱っているかは公開されていないため、この記事では断定していません。
本メディア「ロカオン研究室」は、ローカルで完結する音声入力アプリ「ロカオン」を開発する合同会社ヒバナが運営しています。他社製品も、当社製品と同じ物差しで確認して書きます。記事中の他社製品の権利は各社に帰属します。

