米Appleは、同社の機械学習研究部門(Apple Machine Learning Research)を通じて、次世代基盤モデルファミリー「Apple Foundation Models 3(AFM 3)」の包括的な技術仕様を公式発表しました。
今回の発表における最大の技術革新は、オンデバイス最高峰モデル「AFM 3 Core Advanced」に採用された新開発の疎活性化アーキテクチャ「Instruction-Following Pruning(IFP)」です。
従来のLLMは全パラメータをDRAM(メインメモリ)に常駐させる必要があり、ハードウェアスペックに制約のあるコンシューマー端末での巨大モデル動作は極めて困難でした。
AFM 3 Core Advancedでは、モデル全体の膨大な重みを端末内のNANDフラッシュストレージに保持し、ユーザーからの入力プロンプトに応じて軽量な選択ブロックが最適な専門家(Expert)を特定した上で、高帯域DRAMへ瞬時にロード・結合する動的パッチ機構を導入。
常時稼働する「共有Expert」と組み合わせることで、データ転送のオーバーヘッドを極小化しつつ、従来のDRAM制限を打ち破るモデル規模と低遅延なレスポンスをオンデバイス環境で同時に実現しました。
さらに、プライベート・クラウド・コンピュート(PCC)上で稼働する「AFM 3 Cloud」では並列トラック型MoE(PT-MoE)を大幅に安定化させ、画像生成・編集モデル「ADM 3 Cloud」とともに次世代Apple Intelligenceの頭脳としてOS全域へ統合されます(一次ソース:Apple Machine Learning Research 公式論文)。
