配信日: 2026-10-05 LLM・モデル重要度: ★★★★★ 読了目安: 約2分

Google、話者分離AI「DiarizationLM」公開

REPORTED BY BNF AI NEWS EDITORIAL DESKSPECIAL DISPATCH
Google、話者分離AI「DiarizationLM」公開

この記事の要点(3行ダイジェスト)

  • Googleが音声文字起こしの「誰が発言したか」を高精度特定するDiarizationLMをオープン公開。
  • 軽量モデルGemma 4(4B)を基盤に、既存の文字起こしパイプラインの後処理として即時挿入可能。
  • 大規模な音声認識器を再学習することなく、話者誤認エラー率(WDER)を大幅に削減。

米Googleの研究チームは、会議や対話の音声認識・文字起こしにおいて最大の難所とされる「話者分離(誰がいつ発言したかの特定)」を高精度に行う特化型オープンモデル「DiarizationLM-Gemma-4-E4B-v1」をHugging Face上で公式公開しました。

従来の音声話者分離は音響的特徴(声紋)に依存していたため、声が似ている話者や発言が重なる(オーバーラップ)場面で判定ミスが頻発していました。DiarizationLMは、Googleの「Gemma 4(4B)」をベースにファインチューニングされており、音響情報に加えて対話の言語的(会話の流れや呼応関係)をが統合的に判断することで、発言者の切り替わりを高精度に識別します。

本モデルの最大の特徴は、既存のASR(自動音声認識)システム本体を一切変更・再学習することなく、テキスト出力の直後に挿入する「ポストプロセッサー(後処理)」として機能する点です。これにより、既存の文字起こしインフラを活かしたまま、話者誤認エラー率(WDER)を劇的に改善できます(一次ソース:Hugging Face Google DiarizationLM Model / Google Research Official Blog)。

DAILY AI NEWSLETTER — 朝刊ダイジェスト

毎朝8時、業界の最重要AIニュースを5分でキャッチアップ。

主要モデルの最新発表、現場で即使える実務プロンプト、法規制の動向を専門編集局が毎朝要約してお届けします。

✓ 完全無料✓ 毎朝8:00配信✓ いつでもワンクリック解除✓ スパムゼロ