Диаризация говорящих: кто что сказал в твоих записях
Август 2026 · 5 минут чтения
Короткий ответ: Диаризация говорящих разделяет звук по тому, кто говорит, и подписывает каждую строку (S1, S2, S3…) — и AddSub делает это вживую, пока ты смотришь. Интервью, подкасты и созвоны превращаются в расшифровки, где всегда понятно, кто что сказал.
Почему метки говорящих важны
Обычная расшифровка интервью на двоих — это стена текста: непонятно, кто спрашивает, а кто отвечает. Диаризация решает это, присваивая каждому сегменту постоянную личность говорящего. Когда ты воспроизводишь записанное интервью, подкаст с несколькими ведущими или командный созвон, AddSub раскрашивает каждую строку по говорящему (S1, S2, S3…), чтобы разговор читался естественно.
Как работает диаризация в AddSub
- Разделение голосов — модель сегментации находит, где сменяется говорящий.
- Встраивания голосов — голос каждого сегмента получает свой «отпечаток».
- Кластеризация — похожие голоса группируются в личности говорящих.
- Постоянные метки — личности сопоставляются на протяжении сессии, так что S1 остаётся S1.
Ключевая деталь: метки AddSub — commit-once: когда говорящий идентифицирован, его метка не перескакивает в середине сессии, поэтому расшифровки остаются стабильными на длинных записях.
Как добиться лучшей точности
- Держи фоновый шум на минимуме — чистое аудио с двумя говорящими даёт почти идеальное разделение.
- Дай ~30 секунд — метки стабилизируются по мере кластеризации голосов; первые строки могут сходиться.
- Различимые голоса помогают — очень похожие голоса (например, два однополых говорящих по телефону) разделить сложнее.
- Работает вживую и офлайн — и поток в реальном времени, и экспортированные расшифровки несут метки говорящих.
Подпиши каждого говорящего — бесплатно 7 дней
Платить для старта не нужно. Скачать для macOS.