Балльная или бинарная оценка звонка: что честнее
Короткий ответ
Бинарная оценка (выполнено/не выполнено) даёт более стабильный результат между разными проверяющими, чем шкала от 1 до 5. Кажущаяся точность балльной шкалы на практике превращается в источник расхождений: чем отличается "тройка" от "четвёрки" по критерию — вопрос, на который разные люди отвечают по-разному.
Пошаговое сравнение
Бинарная шкала
Критерий либо выполнен, либо нет. Пример: "менеджер задал минимум два уточняющих вопроса о задаче клиента" — здесь легко посчитать факт и почти невозможно интерпретировать двояко.
Балльная шкала
Критерий оценивается от 1 до 5 по степени выраженности. Пример: "насколько убедительно менеджер аргументировал предложение" — на этот вопрос два разных проверяющих ответят по-разному даже при одинаковом восприятии звонка, просто потому что у них разные внутренние представления о шкале.
Когда балльная шкала оправдана
Не всегда бинарность работает лучше — для критериев, где действительно есть градация качества (например, "насколько плавно менеджер провёл переход от выявления потребности к презентации"), балльная шкала может нести больше информации. Но такие критерии должны быть редкими исключениями, а не правилом.
Практический вывод
Оптимальная схема: большинство критериев формулируются бинарно с чёткими признаками выполнения, и только 1-2 критерия, требующих реальной градации, оцениваются по шкале — с максимально конкретным описанием каждого балла, а не абстрактными цифрами.
Частые ошибки
Использование балльной шкалы "по умолчанию" для всех критериев без проверки, действительно ли нужна градация, или факт "да/нет" достаточен.
Частые вопросы
Как балльная и бинарная оценка влияют на итоговый процент качества? При бинарной оценке процент считается напрямую как доля выполненных критериев. При балльной нужна дополнительная нормализация — что усложняет расчёт без явной пользы.
Что проще внедрить для автоматической оценки ИИ? Бинарные критерии проще и надёжнее для языковой модели — она реже ошибается в ответе "да/нет с цитатой", чем в присвоении балла по расплывчатой шкале.
Автор: редакция Auditka AI. Экспертная проверка: Александр Аничкин, основатель Auditka AI.