Speaker Diarization

Диаризация звонков: как ИИ различает менеджера и клиента

Диаризация отвечает на вопрос не «что сказано?», а «кто это сказал?». Для анализа телефонных переговоров это критически важно: одна и та же фраза имеет разный смысл в устах клиента, менеджера или третьего участника.

Что такое speaker diarization

Speaker diarization - это автоматическое разделение аудиозаписи на фрагменты, принадлежащие разным говорящим. Результат обычно выглядит как последовательность меток: Speaker 1 произнёс один фрагмент, Speaker 2 ответил, затем снова говорит Speaker 1. Система при этом не обязана знать реальные имена людей. Её базовая задача - понять, какие участки записи относятся к одному и тому же голосу.

В технической документации облачных систем распознавания речи diarization описывается именно как обнаружение смены говорящего и маркировка отдельных голосов. Это отличается от идентификации личности. Диаризация говорит "тот же спикер", но не обязательно "это Иван Петров".

Для аналитики звонков этого часто достаточно: после разделения реплик прикладная логика может определить, какая сторона разговора является менеджером, а какая клиентом.

Диаризация, распознавание речи и каналы записи - не одно и то же

Распознавание речи отвечает за преобразование звука в слова. Диаризация работает с принадлежностью этих слов конкретным голосам. Эти задачи связаны, но технически различны. Хороший транскрипт без разделения участников может оказаться мало полезным для оценки менеджера, а идеальная разметка спикеров бессмысленна без понятного текста.

Есть ещё третий вариант - многоканальная запись. Некоторые телефонные системы сохраняют голос сотрудника в одном канале, а голос клиента в другом. Тогда роли можно разделить по структуре файла, и сложная акустическая кластеризация может не понадобиться. В одноканальном аудио оба голоса уже смешаны, поэтому приходится анализировать характеристики речи и моменты смены говорящего.

При проектировании аналитики важно сначала понять, какие данные предоставляет телефония, и только затем выбирать способ разделения.

Как система отличает один голос от другого

Современная диаризация обычно строится из нескольких этапов. Сначала определяется, где в аудио вообще присутствует человеческая речь. Затем звук разбивается на подходящие сегменты. Для каждого сегмента нейросетевая модель строит компактное числовое представление голоса, которое часто называют speaker embedding. После этого похожие представления группируются в кластеры.

Если два фрагмента имеют устойчиво похожие голосовые признаки, алгоритм считает, что они принадлежат одному человеку. Кластеризация повторяется для всей записи, а на выходе система получает временную разметку спикеров.

Это не распознавание человека по биометрической базе. В обычном сценарии модель сравнивает голоса внутри конкретной записи. Ей важно понять, какие сегменты похожи между собой, а не установить личность по паспорту или заранее сохранённому образцу.

Почему телефонный разговор сложнее обычного аудио

В лабораторной записи люди говорят по очереди и находятся рядом с хорошими микрофонами. В реальном звонке всё иначе. Собеседники перебивают друг друга, говорят одновременно, используют гарнитуры разного качества, меняют громкость, уходят в помещение с эхом или включают громкую связь.

Сложный случай - очень короткие реплики: "да", "нет", "понял", "секунду". В них мало акустического материала для уверенного сравнения голоса. Ещё одна проблема - фоновые звуки, музыка ожидания и автоматические сообщения. Алгоритм должен либо исключить их, либо не принять за нового участника.

Если в разговор внезапно подключается коллега клиента или звонок переводят между сотрудниками, ожидаемое число спикеров меняется. Поэтому настройка "в разговоре всегда два человека" может быть удобной, но не универсальной.

Что происходит, когда люди перебивают друг друга

Одновременная речь остаётся одной из самых трудных частей задачи. В коротком участке записи физически присутствуют сразу два голоса. Простая система вынуждена назначить сегмент одному спикеру, хотя по факту говорят оба. Более сложные подходы отдельно обнаруживают overlap, то есть наложение речи, или пытаются разделить аудиосигналы.

Для бизнес-аналитики перебивания важны сами по себе. Если компания оценивает культуру общения, факт регулярного наложения реплик может быть отдельным сигналом. Но важно не путать акустический факт одновременной речи с намеренной грубостью: клиент и менеджер могут начать говорить одновременно случайно.

Поэтому автоматическая метрика становится полезнее, когда она показывает конкретный фрагмент разговора и позволяет быстро проверить контекст.

Как метки Speaker 1 и Speaker 2 превращаются в «менеджер» и «клиент»

После диаризации остаётся прикладная задача назначения ролей. Метка Speaker 1 сама по себе ничего не говорит о должности. Роль можно определить по каналу телефонии, данным CRM, тому, кто инициировал звонок, характерным служебным фразам или сочетанию нескольких сигналов.

Ошибка роли особенно опасна для чек-листа продаж. Например, вопрос о бюджете должен задавать менеджер, а возражение о цене обычно исходит от клиента. Если стороны перепутаны, система способна формально найти нужную фразу, но сделать неправильный вывод о качестве работы сотрудника.

Поэтому в серьёзных сценариях полезно тестировать не только точность текста, но и корректность распределения реплик по ролям на реальных звонках компании.

Как проверять качество диаризации

Качество нельзя оценить по одному красивому примеру. Нужна выборка разных звонков: коротких и длинных, входящих и исходящих, с хорошим и плохим звуком, с перебиваниями и третьими участниками. Для каждого звонка эталонная разметка сравнивается с автоматической.

В академических задачах используют специальные метрики ошибки диаризации, которые учитывают пропущенную речь, ложное обнаружение речи и неправильное назначение спикера. В бизнесе к этому стоит добавить более понятную проверку: насколько часто система правильно определяет сторону диалога в тех фрагментах, которые влияют на оценку менеджера.

Даже небольшая общая ошибка может быть критичной, если она систематически возникает на ключевых эпизодах, например при обсуждении цены или следующего шага.

Зачем диаризация нужна бизнесу

Правильное разделение участников позволяет считать показатели отдельно для менеджера и клиента, искать вопросы каждой стороны, анализировать последовательность реплик и связывать события с ответственным сотрудником. Без этого трудно объективно оценивать этапы разговора.

  • Можно отделять вопросы менеджера от вопросов клиента.
  • Можно искать возражения со стороны клиента, а не любое упоминание похожей фразы.
  • Можно анализировать перебивания и распределение реплик.
  • Можно точнее связывать рекомендации с действиями сотрудника.
  • Можно быстрее переходить к конкретному моменту разговора при обучении.

Voice-Tec на главной странице описывает анализ этапов продаж, ошибок менеджеров, возражений и качества коммуникации. При этом конкретный механизм разделения спикеров публично не указан, поэтому корректно рассматривать diarization здесь как общую технологию отрасли, а не заявленную внутреннюю функцию продукта.

Посмотрите, как Voice-Tec работает с реальными звонками

Voice-Tec анализирует 100% разговоров, помогает находить ошибки менеджеров, слабые этапы продаж и проблемные звонки. На главной странице собраны возможности сервиса, интеграции, тарифы и примеры аналитики.