Calculateur de taux d'erreur sur les mots
Collez le texte exact et une transcription automatique. Vous obtenez le taux affiché par tous les prestataires — et, juste en dessous, la répartition réelle des erreurs. S'exécute dans votre navigateur.
La transcription exacte
La transcription à évaluer
Pourquoi cette ventilation a son importance
Le taux d'erreur sur les mots correspond au nombre de mots substitués, supprimés et insérés divisé par la longueur de la transcription exacte. C'est une mesure réelle, qui accorde la même importance à chaque mot.
C'est bien là le problème. Prenez deux transcriptions d'une même heure d'enregistrement. La première affiche un score de 3 %, et chaque erreur est un mot de remplissage ou un faux départ. La seconde affiche 1 %, et ses erreurs sont un nom de famille, un chiffre dans un débat budgétaire et un « pas » oublié dans une négation. La seconde remporte le comparatif par un facteur de trois. Pourtant, la première est publiable ; la seconde fait dire à quelqu'un qu'il accepte ce qu'il a en réalité refusé.
Le chiffre ci-dessus est donc celui que vous verriez sur une page marketing, et le tableau en dessous est celui qui détermine si la transcription est réellement exploitable. Nous avons développé cette réflexion dans Ce que « 99 % de précision » veut réellement dire.
Comment le calcul est effectué
- La casse et la ponctuation sont ignorées
- Telle que la métrique est définie habituellement. « Le chat s'est assis. » et « le chat s'est assis » obtiennent un score identique.
- Les noms sont les mots avec majuscule en milieu de phrase
- Une approximation simple, mais honnête : chaque phrase commence par une majuscule, donc une majuscule en début de phrase n'apprend rien et n'est pas comptabilisée.
- Les nombres comptabilisent les chiffres et les nombres écrits en toutes lettres
- « 240 », « eleven » et « percent » entrent tous dans la même catégorie. Les chiffres comptent dans toutes les langues ; les nombres en toutes lettres et les négations uniquement en anglais.
- Chaque mot entre dans une seule catégorie
- Les plus lourdes de conséquences en premier : un « no » omis est comptabilisé comme une négation, qu'il ait comporté une majuscule ou non.
- Les insertions n'ont pas de catégorie
- Les catégories sont calculées sur la transcription exacte, et un mot inventé n'y a pas d'équivalent. Il est tout de même comptabilisé dans le taux.
Nous ne publions pas de taux de précision
Nous pourrions choisir un comparatif avantageux et afficher un bon résultat, comme tout le monde le fait. Cela ne vous apprendrait rien sur votre propre enregistrement. Au lieu de cela, txscribe rend ses erreurs repérables : chaque mot est horodaté, vous cliquez sur une ligne et vous entendez si elle est correcte.
Voir ce que fait l'outil