重点
llama.cpp 发布 v0.6.0,新增扩展批处理API并支持GLM-5.3-Flash
llama.cpp v0.6.0 版本引入了用于混合令牌/嵌入输入的 `llama_batch_ext` 扩展批处理API,并增加了对 GLM-5.3-Flash 模型的支持。
编
潜龙编辑部
发布于 · 2026/10/06 01:06
illustration · QianLong editorial
核心摘要
llama.cpp v0.6.0 版本引入了用于混合令牌/嵌入输入的 `llama_batch_ext` 扩展批处理API,并增加了对 GLM-5.3-Flash 模型的支持。
机会与影响
开发者现在可以使用新的扩展批处理API处理更复杂的模型输入,并利用 GLM-5.3-Flash 模型在本地 LLM 推理方面获得更广泛的兼容性。
来源信息
该条资讯来自 github.com。标签:重点。相关平台:github。
潛