指南
说话人分离:谁在你的录音中说了什么
2026 年 8 月 · 5 分钟阅读
简短回答: 说话人分离按说话者分离音频,并为每一行标注(S1、S2、S3…)——而 AddSub 会在你观看时实时完成。访谈、播客和会议变成了你始终知道谁说了什么的文字记录。
为什么说话人标签很重要
一段双人访谈的纯文字记录就是一面文字墙——你无法分辨谁在提问、谁在回答。分离通过为每个片段分配持久的说话人身份来解决这个问题。当你回放一段录制的访谈、一档有多位主播的播客或一场团队会议时,AddSub 会按说话人(S1、S2、S3…)为每一行着色,让对话读起来自然流畅。
AddSub 的说话人分离如何运作
- 声音分离——一个分割模型找出说话人发生变化的位置。
- 声音嵌入——每个片段的声音被指纹化。
- 聚类——相似的声音被归入说话人身份。
- 持久标注——身份在整个会话中匹配,因此 S1 始终是 S1。
关键细节:AddSub 的标签是一次提交——一旦识别出某个说话人,其标签就不会在会话中途翻转,因此长时间录音的文字记录保持稳定。
获得最佳准确度
- 保持背景噪音较低——清晰的双人音频能带来近乎完美的分离。
- 给它约 30 秒——随着声音被聚类,标签会稳定下来;前几行可能会收敛。
- 不同的声音有帮助——非常相似的声音(例如电话音频中的两位同性说话者)更难分离。
- 实时和离线都可用——实时流和导出的文字记录都带有说话人徽标。
标注每一位说话人——免费 7 天
开始使用无需付款。下载 macOS 版。