重点
vLLM v0.31.0 发布,通过 FlashMLA 显著提升 DeepSeek-V4.1-Flash 性能
vLLM v0.31.0 版本包含 717 次提交,通过将 FlashMLA 巨型注意力结合 NVFP4 压缩 KV 缓存作为 SM100 默认配置,大幅提升了 DeepSeek-V4.1-Flash 的性能。
编
潜龙编辑部
发布于 · 2026/10/05 13:08
illustration · QianLong editorial
核心摘要
vLLM v0.31.0 版本包含 717 次提交,通过将 FlashMLA 巨型注意力结合 NVFP4 压缩 KV 缓存作为 SM100 默认配置,大幅提升了 DeepSeek-V4.1-Flash 的性能。
机会与影响
vLLM 用户现在可以为 DeepSeek-V4.1-Flash 模型实现更快、更高效的推理,尤其是在 SM100 硬件上。
来源信息
该条资讯来自 github.com。标签:重点。相关平台:github。
潛