世界中のAIスタートアップやクラウドプロバイダーが採用するオープンソースLLM高速推論エンジン「vLLM」が、大幅なアーキテクチャ刷新を果たした「vLLM v0.7.0」を正式公開しました。
本バージョンでは、先行開発が進められていた新世代推論コア「V1 Engine」を完全統合。
Pythonレイヤーによるスケジューリング遅延を極小化するC++ゼロオーバーヘッドスケジューラが導入されました。
さらに、長文コンテキストやマルチターン対話における共通KVキャッシュを再利用する「動的プレフィックス・キャッシング」のハードウェア最適化を徹底。
数十万トークン規模の長文コンテキストやバッチ処理時の推論スループットが従来比で最大2.1倍に向上しました。
また、小型モデルで先行予測して高速化するマルチドラフト対応の投機的サンプリング(Speculative Decoding)や、MoE(Mixture of Experts)モデル向けFP8/INT4混合量子化カーネルを標準サポート。
自社GPUクラスタにおける推論コストを大幅に削減し、連続ループを回す自律エージェント基盤の超高速レスポンスを実現します(一次ソース:GitHub vllm-project/vllm リポジトリ / vLLM公式技術ブログ)。
