米Googleの研究チームは、会議や対話の音声認識・文字起こしにおいて最大の難所とされる「話者分離(誰がいつ発言したかの特定)」を高精度に行う特化型オープンモデル「DiarizationLM-Gemma-4-E4B-v1」をHugging Face上で公式公開しました。
従来の音声話者分離は音響的特徴(声紋)に依存していたため、声が似ている話者や発言が重なる(オーバーラップ)場面で判定ミスが頻発していました。DiarizationLMは、Googleのオープンウェイトモデル「Gemma 4(4B)」をベースにファインチューニングされており、音響情報に加えて対話の言語的文脈(会話の流れや呼応関係)をLLMが統合的に判断することで、発言者の切り替わりを高精度に識別します。
本モデルの最大の特徴は、既存のASR(自動音声認識)システム本体を一切変更・再学習することなく、テキスト出力の直後に挿入する「ポストプロセッサー(後処理)」として機能する点です。これにより、既存の文字起こしインフラを活かしたまま、話者誤認エラー率(WDER)を劇的に改善できます(一次ソース:Hugging Face Google DiarizationLM Model / Google Research Official Blog)。
