重点

vLLM v0.31.0 发布,通过 FlashMLA 显著提升 DeepSeek-V4.1-Flash 性能

vLLM v0.31.0 版本包含 717 次提交,通过将 FlashMLA 巨型注意力结合 NVFP4 压缩 KV 缓存作为 SM100 默认配置,大幅提升了 DeepSeek-V4.1-Flash 的性能。

编
潜龙编辑部
发布于 · 2026/10/05 13:08
3 分钟·来源: github.com
vLLM v0.31.0 发布,通过 FlashMLA 显著提升 DeepSeek-V4.1-Flash 性能
illustration · QianLong editorial

核心摘要

vLLM v0.31.0 版本包含 717 次提交,通过将 FlashMLA 巨型注意力结合 NVFP4 压缩 KV 缓存作为 SM100 默认配置,大幅提升了 DeepSeek-V4.1-Flash 的性能。

机会与影响

vLLM 用户现在可以为 DeepSeek-V4.1-Flash 模型实现更快、更高效的推理,尤其是在 SM100 硬件上。

来源信息

该条资讯来自 github.com。标签:重点。相关平台:github。

原文
潛