가이드
화자 분리: 녹음에서 누가 무슨 말을 했는지
2026년 8월 · 5분 읽기
한 줄 요약: 화자 분리는 누가 말하는지에 따라 오디오를 나누고 각 줄에 라벨(S1, S2, S3…)을 붙입니다 — 그리고 AddSub는 시청하는 동안 이를 실시간으로 수행합니다. 인터뷰, 팟캐스트, 회의가 언제나 누가 무슨 말을 했는지 아는 대본이 됩니다.
화자 라벨이 중요한 이유
2인 인터뷰의 일반 대본은 글벽과 같습니다 — 누가 질문하고 누가 답하는지 알 수 없죠. 화자 분리는 각 구간에 지속적인 화자 정체성을 부여해 이 문제를 해결합니다. 녹화된 인터뷰, 여러 진행자가 있는 팟캐스트, 팀 회의를 재생할 때 AddSub가 각 줄을 화자별로 색칠해(S1, S2, S3…) 대화가 자연스럽게 읽히도록 합니다.
AddSub의 화자 분리 작동 방식
- 음성 분리 — 화자가 바뀌는 지점을 세그멘테이션 모델이 찾습니다.
- 음성 임베딩 — 각 구간의 음성을 지문처럼 기록합니다.
- 클러스터링 — 비슷한 음성을 화자 정체성으로 묶습니다.
- 지속적 라벨링 — 세션 전반에 걸쳐 정체성을 일치시켜 S1이 계속 S1로 유지됩니다.
핵심 디테일: AddSub의 라벨은 확정 후 유지(commit-once) 방식입니다 — 화자가 한 번 식별되면 세션 도중 라벨이 뒤집히지 않아, 긴 녹음에서도 대본이 안정적으로 유지됩니다.
최상의 정확도를 얻는 법
- 배경 소음을 낮게 유지하세요 — 깨끗한 2인 음성은 거의 완벽한 분리를 제공합니다.
- 약 30초의 시간을 주세요 — 음성이 클러스터링되면서 라벨이 안정화됩니다; 처음 몇 줄은 수렴할 수 있습니다.
- 뚜렷한 목소리가 도움이 됩니다 — 매우 비슷한 목소리(예: 전화 오디오의 동성 화자 2명)는 분리하기 더 어렵습니다.
- 실시간과 오프라인 모두 작동 — 실시간 스트림과 내보낸 대본 모두 화자 배지를 담고 있습니다.
모든 화자에 라벨을 붙이세요 — 7일 무료
시작하는 데 결제가 필요 없습니다. macOS용 다운로드.