AI軽量化技術を手がけるPrism MLは、アリババの最新マルチモーダル基盤「Qwen3.8-27B」を三値量子化(Ternary Quantization、-1/0/+1の3値重み付け)によって極限まで圧縮したオープンソースモデル「Ternary Bonsai 2 27B」を公開しました。理論値1.72ビット相当への圧縮に成功し、従来のFP16形式で約54GBに達していたモデル容量をわずか6〜8GB前後にまで削減しています。
大幅な軽量化を行いながらも、高度な事後アライメント技術によって主要な推論・知識ベンチマークで元のQwen3.8-27Bの98.2%に匹敵する精度を維持しています。さらに、262kトークンの大規模コンテキストウィンドウをそのまま保持しており、長文解析やリポジトリ全体のコード読解をローカル環境でこなします。
同モデルはApple SiliconのMetal APIやllama.cppに最適化された専用ランタイムとともに提供されており、MacBook Proや12GB程度のVRAMを備えた民生用デスクトップPC上で高速なトークン生成速度を実現します。
高価なクラウドGPUに依存せず、企業の機密データを完全にオンプレミスにとどめたまま中規模フロンティア級のAI推論を実行できる新たな選択肢として、開発者コミュニティで急速に注目を集めています(一次ソース:Prism ML Official Model Repository / Bonsai Quantization Engine GitHub)。
