Что такое WER и как измерить качество распознавания речи
Короткий ответ
WER (Word Error Rate) — стандартный способ объективно измерить точность распознавания речи: доля слов в автоматической расшифровке, которые отличаются от эталонного текста (замены, пропуски, лишние слова), делённая на общее число слов в эталоне. Чем ниже WER, тем точнее распознавание.
Как считается
WER = (число замен + число пропусков + число лишних слов) / общее число слов в эталонном тексте.
Для расчёта нужен эталон — точная ручная расшифровка того же звонка, с которой сравнивается автоматическая. Это делает измерение трудозатратным (нужна ручная разметка), но даёт объективную, воспроизводимую цифру вместо субъективного впечатления "распознаёт хорошо или плохо".
Как использовать на практике
Возьмите 10-15 звонков, сделайте ручную расшифровку каждого, прогоните через систему распознавания и посчитайте WER для каждого. Это даст объективную базовую цифру точности именно на ваших типах записей — общие заявленные производителем показатели точности почти всегда получены на других, обычно более чистых данных.
Интерпретация показателя
Низкий WER не гарантирует, что расшифровка пригодна для содержательного анализа — важно смотреть, какие именно слова искажаются. Ошибка в служебном слове менее критична, чем искажение ключевого термина или цифры (например, названной цены).
Частые вопросы
Какой WER считается приемлемым для анализа звонков? Универсального порога нет — приемлемость зависит от того, насколько критичны ошибки для конкретных критериев оценки. Показатель стоит интерпретировать вместе с содержательной проверкой, а не как самостоятельный критерий.
Можно ли снизить WER без замены модели распознавания? Да, частично — за счёт улучшения качества исходной записи (шумоподавление, требование гарнитуры вместо спикерфона), см. «Шум, акцент, спикерфон: как улучшить распознавание».
Автор: редакция Auditka AI. Экспертная проверка: Александр Аничкин, основатель Auditka AI.