重点

llama.cpp 发布 v0.6.0,新增扩展批处理API并支持GLM-5.3-Flash

llama.cpp v0.6.0 版本引入了用于混合令牌/嵌入输入的 `llama_batch_ext` 扩展批处理API,并增加了对 GLM-5.3-Flash 模型的支持。

编
潜龙编辑部
发布于 · 2026/10/06 01:06
3 分钟·来源: github.com
llama.cpp 发布 v0.6.0,新增扩展批处理API并支持GLM-5.3-Flash
illustration · QianLong editorial

核心摘要

llama.cpp v0.6.0 版本引入了用于混合令牌/嵌入输入的 `llama_batch_ext` 扩展批处理API,并增加了对 GLM-5.3-Flash 模型的支持。

机会与影响

开发者现在可以使用新的扩展批处理API处理更复杂的模型输入,并利用 GLM-5.3-Flash 模型在本地 LLM 推理方面获得更广泛的兼容性。

来源信息

该条资讯来自 github.com。标签:重点。相关平台:github。

原文
潛