ガイド
話者分離:録音で誰が話したかを特定
2026年8月 · 5分で読める
端的に言うと: 話者分離は、誰が話しているかで音声を分離し、各行にラベル(S1、S2、S3…)を付けます。そしてAddSubはこれを視聴中にライブで行います。インタビュー、ポッドキャスト、会議が、誰が何を言ったかが常に分かる文字起こしになります。
話者ラベルが重要な理由
2人のインタビューをそのまま文字起こしすると、文字の壁になり、誰が質問し誰が答えているか分かりません。話者分離は、各セグメントに永続的な話者IDを割り当てることでこの問題を解決します。録画したインタビュー、複数ホストのポッドキャスト、チーム会議を再生すると、AddSubが各行を話者(S1、S2、S3…)ごとに色分けするため、会話が自然に読めます。
AddSubの話者分離の仕組み
- 音声の分離 — セグメンテーションモデルが話者の切り替わりを検出します。
- 声の埋め込み — 各セグメントの声をフィンガープリント化します。
- クラスタリング — 似た声を話者IDにグループ化します。
- 永続的なラベル付け — セッションを通じてIDを照合するため、S1はS1のままです。
重要なポイント:AddSubのラベルはコミットオンリーです。一度話者を特定したら、セッション中にラベルが入れ替わらないため、長時間の録音でも文字起こしが安定します。
精度を上げるには
- 背景ノイズを抑える — クリーンな2人音声ならほぼ完璧に分離できます。
- 約30秒待つ — 声がクラスタリングされるとラベルが安定します。最初の数行は収束することがあります。
- 声が異なる方が有利 — 非常に似た声(例:電話音声の同性2人)は分離が難しくなります。
- ライブでもオフラインでも動作 — リアルタイムストリームも書き出した文字起こしも、どちらも話者バッジを保持します。
すべての話者にラベルを — 7日間無料
開始にあたって支払いは不要です。macOS版をダウンロード。