単語誤り率(WER)計算ツール
正解テキストと自動文字起こしの結果を貼り付けてください。各ベンダーが公表する誤り率と、その下に実際の誤りの発生箇所が表示されます。ブラウザ上で実行されます。
正解のトランスクリプト
評価対象のトランスクリプト
内訳が重要である理由
単語誤り率(WER)とは、置換、削除、挿入された単語の数を正解テキストの単語数で割った値です。客観的な測定指標ですが、すべての単語を等しい重要度として扱います。
それこそが問題なのです。同じ1時間の録音に対する2つのトランスクリプトを考えてみてください。一方はスコアが3%で、すべての誤りがつなぎ言葉(フィラー)や言い直しです。もう一方はスコアが1%で、誤りが苗字、予算議論の数字、脱落した「don’t」だったとします。ベンチマーク上は後者が3倍優れています。しかし、実際に公開できるのは前者です。後者は、拒否したはずの提案に同意したかのように引用してしまうからです。
つまり、上にある数字はマーケティング資料によく掲載される数値であり、下の表こそがそのトランスクリプトが実用に耐えうるかを判断する基準です。この議論の詳細については、「精度99%」が実際に意味することにまとめています。
カウントの仕組み
- 大文字小文字と句読点は無視されます
- 一般的な指標の定義に準拠しています。「The cat sat.」と「the cat sat」は同一とみなされます。
- 固有名詞は文中に現れる大文字表記の語です
- 大まかですが実用的な近似値です。すべての文は大文字で始まるため、文頭の大文字は判断材料にならず、カウントされません。
- 数字は算用数字および数詞をカウントします
- 「240」、「eleven」、「percent」はすべて同じ分類に入ります。数字はどの言語でもカウントされますが、言葉で書かれた数字と否定表現は英語でのみカウントされます。
- 各単語は必ずいずれか1つの分類に割り当てられます
- 最も影響が大きいものから順に:脱落した「no」は、大文字であるかどうかにかかわらず否定としてカウントされます。
- 挿入語には分類先がありません
- カテゴリは正解テキストを基準にカウントされますが、自動生成によって捏造された単語には対応する正解がありません。それでも誤り率の計算には含まれます。
精度の数値を公表しない理由
他社がするように、都合のよいベンチマークを選んで見栄えのよい数値を出すこともできます。しかし、それではお客様の録音に対して何の意味も持ちません。txscribeが代わりに行うのは、誤りを見つけやすくすることです。すべての単語にタイムスタンプが付いているため、行をクリックするだけで正しいかどうかを耳で確認できます。
機能を見る