COMIXAI吉川 聡史
しくみ・技術わしゃぶんり2026年9月27日更新Speaker Diarization

話者分離(ダイアライゼーション)とは?

DEFINITION — ひとことで言うと

録音の中で「誰が、いつ話したか」を機械的に分ける技術。文字起こしとは別の処理で、組み合わせると発言者つきの議事録になる。AI議事録の「誰の発言か分からない」を解く部分。

DIAGRAM — 図解
文字起こしだけの場合と、話者分離を足した場合の図解文字起こしだけだと録音文字起こしぜんぶ一本の文章話者分離を足すと録音+話者分離誰がいつ話したか話者1:〜話者2:〜「誰が」はAIが分ける。「それが誰か」は人が当てる精度が落ちるのは、声が重なるとき・人数が多いとき・マイクが遠いとき
文字にするのと、誰の声か分けるのは、別の仕事

話者分離(ダイアライゼーション)は、音声の中で「誰が、いつ話したか」を切り分ける技術です。大事なのは、文字起こしとは別の仕事だということ。文字起こしAIは「何と言ったか」を文字にしますが、そのままでは全員の発言が一本の文章としてつながってしまいます。そこに話者分離を重ねると、「話者1:〜」「話者2:〜」と発言者ごとに分かれた記録になります。AI議事録を使って「誰の発言か分からない」と困ったことがあるなら、足りていなかったのはこの処理です。なお多くの場合、機械が分けるのは「話者1/話者2」までで、それが誰なのかという名前は人が当てはめます。

2026年9月にこの言葉が広まったのは、NVIDIAが「Nemotron 3 Diarization」というモデルを、誰でも使える形(オープンウェイト・商用利用可)で公開したからです。パラメータ数は1億(0.1B)と小さく、最大8人まで、声が重なった部分も含めて区別できるとされています。録音ファイルをあとから処理するだけでなく、会議中にその場で処理する使い方にも対応します。小さいモデルなので手元の機械でも動かしやすく、議事録ツールに組み込みやすいことが注目された理由です。

文字起こしとセットで効く

実務では、①音を文字にする(文字起こし)②誰が話したかを分ける(話者分離)③名前を当てる——の3段階を経て「使える議事録」になります。①だけだと読みにくく、②まで来ると「誰が何を言ったか」を追えるようになる。③は人がやるか、参加者リストと突き合わせて自動化します。AI議事録サービスの品質差は、②がどれだけ正確かで出やすい部分です。

精度が落ちやすいのは、声が重なったとき、人数が多いとき、マイクが遠いとき。対面の会議で1本のマイクを囲むと、オンライン会議より条件は厳しくなります。議事録の精度に不満があるなら、モデルやサービスを変える前に「1人1マイクに近づける」ほうが効くことが多いです。

その場で分けられると、何が変わる?

Nemotron 3 Diarizationは、会議の最中に流れてくる音声をその場で処理する使い方にも対応しています。遅れの設定は3段階あり、いちばん短い設定なら0.32秒ぶんの音声から結果を出せるとされています(長めの設定にすると前後の文脈を使えるぶん精度が上がります)。

その場で分けられると、会議中の画面に「いま誰が話しているか」と字幕を同時に出す、発言量の偏りをその場で見せる、といった使い方ができます。あとから読むための議事録から、会議そのものを支える道具へ——というのがこの分野の進み方です。

使うときの注意

第一に、声そのものは個人情報に近い扱いが必要です。誰の声かを機械が区別できる以上、録音の保管期間と共有の範囲は決めてから使うのが安全です。第二に、録音することを参加者に伝えること。AI議事録の導入で最初につまずくのは技術ではなく、この合意形成のほうです。

第三に、分けた結果は完璧ではない前提で扱うこと。重要な会議ほど、発言の帰属(誰が言ったか)を人が確認する工程を残しておくのが実務的です。「AIが誰の発言か分けてくれた」は、議事録の下書きが1段よくなったという意味であって、記録として確定したという意味ではありません。

話者分離(ダイアライゼーション)のよくある質問

Q.話者分離と文字起こしは何が違いますか?
A.

文字起こしは「何と言ったか」を文字にする処理、話者分離は「誰が、いつ話したか」を分ける処理です。別々の技術で、組み合わせて初めて発言者つきの議事録になります。AI議事録で「誰の発言か分からない」場合、足りていないのは話者分離のほうです。

Q.話者の名前まで分かりますか?
A.

多くの場合、機械が分けるのは「話者1/話者2」までで、それが誰なのかという名前は人が当てはめます。参加者リストや声の登録と突き合わせて自動化しているサービスもありますが、標準で名前まで出るとはかぎりません。

Q.Nemotron 3 Diarizationとは何ですか?
A.

NVIDIAが2026年9月に公開した話者分離のモデルです。パラメータ数は1億(0.1B)と小さく、最大8人まで、重なった発話も含めて区別できるとされています。オープンウェイトで商用利用も認められており、議事録ツールに組み込みやすいことから注目されました。

LEARN MORE — もっと深く

マンガ・実践記事で理解する

読むより速い、体感で学ぶ

用語を覚えるより、ストーリーで体感するほうが早い。

役に立ったらシェア→𝕏 ポストB! ブックマーク