Diarização de falante: quem disse o quê nas suas gravações
Agosto de 2026 · 5 min de leitura
A resposta curta: a diarização de falante separa o áudio por quem está falando e rotula cada linha (S1, S2, S3…) — e o AddSub faz isso ao vivo enquanto você assiste. Entrevistas, podcasts e reuniões viram transcrições nas quais você sempre sabe quem disse o quê.
Por que a identificação de falante importa
Uma transcrição simples de uma entrevista entre duas pessoas é um bloco de texto — você não consegue distinguir quem pergunta e quem responde. A diarização resolve isso atribuindo a cada segmento uma identidade de falante persistente. Quando você reproduz uma entrevista gravada, um podcast com vários apresentadores ou uma reunião de equipe, o AddSub colore cada linha por falante (S1, S2, S3…) para que a conversa flua naturalmente.
Como funciona a diarização do AddSub
- Separação de vozes — um modelo de segmentação encontra onde os falantes mudam.
- Embeddings de voz — a voz de cada segmento recebe uma impressão digital.
- Agrupamento — vozes semelhantes são agrupadas em identidades de falante.
- Rotulação persistente — identidades são combinadas ao longo da sessão, então S1 permanece S1.
O detalhe principal: os rótulos do AddSub são commit-once — uma vez que um falante é identificado, seu rótulo não muda no meio da sessão, então as transcrições permanecem estáveis em gravações longas.
Obtendo a melhor precisão
- Mantenha o ruído de fundo baixo — áudio limpo de dois falantes dá uma separação quase perfeita.
- Dê ~30 segundos — os rótulos se estabilizam conforme as vozes são agrupadas; as primeiras linhas podem convergir.
- Vozes distintas ajudam — vozes muito semelhantes (por exemplo, dois falantes do mesmo sexo em áudio de telefone) são mais difíceis de separar.
- Funciona ao vivo e offline — tanto o fluxo em tempo real quanto as transcrições exportadas carregam a identificação de falante.
Rotule cada falante — grátis por 7 dias
Sem pagamento para começar. Baixe para macOS.