詳細・ビジネスへの影響
米Googleは、85以上の言語に対応した次世代の高精度音声認識・音声理解AIモデル「Gemini 3.5 Transcribe」をパブリックプレビュー公開しました。
従来のChirp 3を大幅に上回る認識精度を誇り、背景ノイズや専門用語、日常会話特有の言い間違いの自然な文脈補正に対応。
「えーと」「あの」といった言い淀み(フィラー)を自動除去して読みやすく整形するモードと、発話通りの逐語書き起こしモードの切り替えが可能です。
最大3名までの話者分離(ダイアライゼーション)とサブ秒レベルの超低遅延ストリーミングを実現し、リアルタイム会話処理の基盤を大幅に強化。
開発者向けAPIの提供に加え、macOS版GeminiアプリやChrome、Gboardの新音声入力機能「Rambler」へ即座に統合されます(一次ソース:Google Cloud 公式発表 / Impress Watch報道)。
