AddSubAddSub
ガイド

話者分離:録音で誰が話したかを特定

2026年8月 · 5分で読める

端的に言うと: 話者分離は、誰が話しているかで音声を分離し、各行にラベル(S1、S2、S3…)を付けます。そしてAddSubはこれを視聴中にライブで行います。インタビュー、ポッドキャスト、会議が、誰が何を言ったかが常に分かる文字起こしになります。

話者ラベルが重要な理由

2人のインタビューをそのまま文字起こしすると、文字の壁になり、誰が質問し誰が答えているか分かりません。話者分離は、各セグメントに永続的な話者IDを割り当てることでこの問題を解決します。録画したインタビュー、複数ホストのポッドキャスト、チーム会議を再生すると、AddSubが各行を話者(S1、S2、S3…)ごとに色分けするため、会話が自然に読めます。

AddSubの話者分離の仕組み

  1. 音声の分離 — セグメンテーションモデルが話者の切り替わりを検出します。
  2. 声の埋め込み — 各セグメントの声をフィンガープリント化します。
  3. クラスタリング — 似た声を話者IDにグループ化します。
  4. 永続的なラベル付け — セッションを通じてIDを照合するため、S1はS1のままです。

重要なポイント:AddSubのラベルはコミットオンリーです。一度話者を特定したら、セッション中にラベルが入れ替わらないため、長時間の録音でも文字起こしが安定します。

精度を上げるには

  • 背景ノイズを抑える — クリーンな2人音声ならほぼ完璧に分離できます。
  • 約30秒待つ — 声がクラスタリングされるとラベルが安定します。最初の数行は収束することがあります。
  • 声が異なる方が有利 — 非常に似た声(例:電話音声の同性2人)は分離が難しくなります。
  • ライブでもオフラインでも動作 — リアルタイムストリームも書き出した文字起こしも、どちらも話者バッジを保持します。

すべての話者にラベルを — 7日間無料

開始にあたって支払いは不要です。macOS版をダウンロード。

何でも読める。何でも観られる。

macOS のためのリアルタイム多言語字幕・翻訳。100% オンデバイスで、完全にプライベート。