一言でいうと

人が話した音声をコンピューターで文字列へ変換する技術。

より具体的には

マイクや音声ファイルから得た音響情報を解析し、言語モデルなどを使って発話内容を文字列として推定する。音声入力、字幕、議事録、検索用の文字起こしなどに利用される。

結果の精度は、言語、話し方、録音品質、周囲の雑音、固有名詞、数字、使用モデルなどに左右される。ASRが作る文字列と、その後に文章を読みやすく整形する処理は別の段階として評価すると、誤認識と後処理による意味変更を区別しやすい。

関連記事での使用例

HandyとローカルLLMで音声入力環境を構築しようとした話

この記事では、Handy上の複数の音声認識モデルを比較し、Whisper Mediumを暫定既定にした。ASR結果をローカルLLMへ渡す構成では、音声認識と文章整形を分けて評価している。

関連