モデル蒸留(知識蒸留)
巨大で高精度なAIモデル(教師モデル)が持つ知識を、より小さく軽量なモデル(生徒モデル)へ引き継がせる機械学習の手法です。精度を維持したまま軽量化・高速化できます。
モデル蒸留(Model Distillation/知識蒸留)とは、巨大で高精度なAIモデル(教師モデル)が学習した知識や推論パターンを、パラメータ数が少なく軽量なモデル(生徒モデル)へと引き継がせる技術のことです。
通常、小さなAIモデルを直接ゼロから学習させても高い精度を得ることは困難です。しかし、完成された巨大な教師モデルが出力する確率分布や推論結果(ソフトターゲット)をお手本として学習させることで、小さなモデルであっても教師モデルに近い高い能力を獲得させることができます。
モデル蒸留の最大のメリットは、高い精度を維持したままモデルのファイルサイズを軽量化し、推論スピードを飛躍的に高速化できる点にあります。
これにより、巨大モデルを動かすために必要な高額なGPUサーバーの運用コストを大幅に削減でき、スマートフォンやPCなどのエッジデバイス(ローカル環境)上でも快適にAIを動作させることが可能になります。
近年の生成AI開発においては、最新の超大型モデルを教師として機能させ、そこで生成された高品質なデータや思考プロセスを生徒である実用モデルに蒸留して高効率化を図る開発手法が業界の標準となっています。