단어 오류율 계산기
정답 텍스트와 기계 전사 스크립트를 붙여넣으세요. 모든 공급업체가 내세우는 오류율과 함께, 그 아래에 오류가 실제로 발생한 위치를 확인할 수 있습니다. 모든 작업은 브라우저에서 실행됩니다.
정답 스크립트
평가할 스크립트
오류 세부 분류가 중요한 이유
단어 오류율은 대치, 삭제, 삽입된 단어의 수를 올바른 스크립트의 전체 단어 수로 나눈 값입니다. 실제 측정치이며 모든 단어를 동일한 비중으로 다룹니다.
바로 그것이 문제입니다. 동일한 1시간짜리 녹음에 대한 두 개의 스크립트를 예로 들어보겠습니다. 하나는 오류율 3%를 기록했고 모든 오류가 추임새나 말머리를 헛디딘 것에 불과합니다. 다른 하나는 오류율 1%이지만 성씨, 예산 논의에서의 수치, 그리고 빠진 “don’t”가 오류로 잡혔습니다. 두 번째 스크립트가 벤치마크에서는 3배 더 우수합니다. 하지만 실제로 발행할 수 있는 것은 첫 번째 스크립트입니다. 두 번째 스크립트는 거절한 내용을 동의한 것처럼 인용하게 만드니까요.
따라서 위의 수치는 마케팅 페이지에서 보게 되는 수치이며, 그 아래 표는 해당 스크립트가 실제로 쓸모 있는지 판단하는 기준입니다. 이와 관련된 자세한 설명은 ‘정확도 99%’의 진짜 의미 글에 정리해 두었습니다.
계산 방식
- 대소문자와 문장 부호는 무시됩니다
- 일반적인 지표 정의 기준입니다. "The cat sat."과 "the cat sat"은 동일한 것으로 채점됩니다.
- 고유명사는 문장 중간에 나오는 대문자 단어입니다
- 간단하면서도 정직한 근사치 방식입니다. 모든 문장은 대문자로 시작하므로 문장 첫머리의 대문자는 특별한 정보를 제공하지 않아 계산에서 제외됩니다.
- 숫자는 아라비아 숫자와 수사 단어를 집계합니다
- “240”, “eleven”, “percent”은 모두 같은 범주로 분류됩니다. 숫자는 모든 언어에서 집계되지만, 단어로 표기된 숫자와 부정어는 영어에서만 집계됩니다.
- 모든 단어는 정확히 하나의 범주에만 들어갑니다
- 가장 중대한 사항부터 살펴보면, 누락된 “no”는 대문자 표기 여부와 관계없이 부정어로 집계됩니다.
- 삽입 오류에는 범주가 배정되지 않습니다
- 범주는 정답 스크립트를 기준으로 집계되며, 기계가 지어낸 단어는 정답에 대응하는 단어가 없습니다. 하지만 전체 오류율에는 여전히 반영됩니다.
정확도 수치를 공개하지 않는 이유
모두가 하듯 유리한 벤치마크를 골라 그럴듯한 수치를 내세울 수도 있습니다. 하지만 그것은 사용자의 녹음 파일에 대해 아무것도 알려주지 못합니다. txscribe는 그 대신 오류를 직접 찾을 수 있게 만듭니다. 모든 단어에 타임스탬프가 지정되어 있어, 원하는 줄을 클릭하면 음성을 듣고 맞는지 바로 확인할 수 있습니다.
기능 살펴보기