AddSubAddSub
Guias

Diarização de falante: quem disse o quê nas suas gravações

Agosto de 2026 · 5 min de leitura

A resposta curta: a diarização de falante separa o áudio por quem está falando e rotula cada linha (S1, S2, S3…) — e o AddSub faz isso ao vivo enquanto você assiste. Entrevistas, podcasts e reuniões viram transcrições nas quais você sempre sabe quem disse o quê.

Por que a identificação de falante importa

Uma transcrição simples de uma entrevista entre duas pessoas é um bloco de texto — você não consegue distinguir quem pergunta e quem responde. A diarização resolve isso atribuindo a cada segmento uma identidade de falante persistente. Quando você reproduz uma entrevista gravada, um podcast com vários apresentadores ou uma reunião de equipe, o AddSub colore cada linha por falante (S1, S2, S3…) para que a conversa flua naturalmente.

Como funciona a diarização do AddSub

  1. Separação de vozes — um modelo de segmentação encontra onde os falantes mudam.
  2. Embeddings de voz — a voz de cada segmento recebe uma impressão digital.
  3. Agrupamento — vozes semelhantes são agrupadas em identidades de falante.
  4. Rotulação persistente — identidades são combinadas ao longo da sessão, então S1 permanece S1.

O detalhe principal: os rótulos do AddSub são commit-once — uma vez que um falante é identificado, seu rótulo não muda no meio da sessão, então as transcrições permanecem estáveis em gravações longas.

Obtendo a melhor precisão

  • Mantenha o ruído de fundo baixo — áudio limpo de dois falantes dá uma separação quase perfeita.
  • Dê ~30 segundos — os rótulos se estabilizam conforme as vozes são agrupadas; as primeiras linhas podem convergir.
  • Vozes distintas ajudam — vozes muito semelhantes (por exemplo, dois falantes do mesmo sexo em áudio de telefone) são mais difíceis de separar.
  • Funciona ao vivo e offline — tanto o fluxo em tempo real quanto as transcrições exportadas carregam a identificação de falante.

Rotule cada falante — grátis por 7 dias

Sem pagamento para começar. Baixe para macOS.

Leia qualquer coisa. Assista a tudo.

Legendas e tradução multilíngues em tempo real para macOS. 100% no dispositivo, totalmente privado.