AddSubAddSub
指南

说话人分离:谁在你的录音中说了什么

2026 年 8 月 · 5 分钟阅读

简短回答: 说话人分离按说话者分离音频,并为每一行标注(S1、S2、S3…)——而 AddSub 会在你观看时实时完成。访谈、播客和会议变成了你始终知道谁说了什么的文字记录。

为什么说话人标签很重要

一段双人访谈的纯文字记录就是一面文字墙——你无法分辨谁在提问、谁在回答。分离通过为每个片段分配持久的说话人身份来解决这个问题。当你回放一段录制的访谈、一档有多位主播的播客或一场团队会议时,AddSub 会按说话人(S1、S2、S3…)为每一行着色,让对话读起来自然流畅。

AddSub 的说话人分离如何运作

  1. 声音分离——一个分割模型找出说话人发生变化的位置。
  2. 声音嵌入——每个片段的声音被指纹化。
  3. 聚类——相似的声音被归入说话人身份。
  4. 持久标注——身份在整个会话中匹配,因此 S1 始终是 S1。

关键细节:AddSub 的标签是一次提交——一旦识别出某个说话人,其标签就不会在会话中途翻转,因此长时间录音的文字记录保持稳定。

获得最佳准确度

  • 保持背景噪音较低——清晰的双人音频能带来近乎完美的分离。
  • 给它约 30 秒——随着声音被聚类,标签会稳定下来;前几行可能会收敛。
  • 不同的声音有帮助——非常相似的声音(例如电话音频中的两位同性说话者)更难分离。
  • 实时和离线都可用——实时流和导出的文字记录都带有说话人徽标。

标注每一位说话人——免费 7 天

开始使用无需付款。下载 macOS 版。

读懂一切,看遍所有。

macOS 实时多语言字幕与翻译。100% 设备端处理,完全私密。