重点
llama.cpp b11390 版本发布,修复 CUDA MMQ 内存故障
llama.cpp 在 b11390 版本中修复了一个关键的 CUDA MMQ 内存故障,该故障发生在 `n_expert` 远大于 `n_ubatch` 的情况下。
编
潜龙编辑部
发布于 · 2026/10/04 13:08
illustration · QianLong editorial
核心摘要
llama.cpp 在 b11390 版本中修复了一个关键的 CUDA MMQ 内存故障,该故障发生在 `n_expert` 远大于 `n_ubatch` 的情况下。
机会与影响
此修复提高了 llama.cpp 在 CUDA 环境中运行模型的稳定性和可靠性,尤其对使用不同专家和批次配置的用户有益。
来源信息
该条资讯来自 github.com。标签:重点。相关平台:github。
潛