15
7月
趋势·来源 · arxiv.org·2026/07/15
arXiv论文提出格式敏感度指数,评估LLM基准测试鲁棒性
一篇新的arXiv论文提出了“格式敏感度指数”,用以揭示提示词包装中微小的格式差异如何显著影响LLM的基准测试结果。
15
7月
趋势·来源 · arxiv.org·2026/07/15
CANDI:面向小众领域问答的上下文对齐新方法(arXiv)
一项新的arXiv研究提出了CANDI框架,旨在通过上下文对齐提升LLM在医疗诊断、金融咨询等小众领域的问答能力。
15
7月
趋势·来源 · arxiv.org·2026/07/15
研究揭示顶尖LLM在无障碍性方面的不足,例如对盲文支持有限
一项新的arXiv研究揭示了当前最先进的LLM在无障碍性方面的缺陷,例如它们无法有效处理盲文等结构受限、对无障碍至关重要的模态。
15
7月
重点·来源 · developers.google.com·2026/07/15
Gemini 2.5 Pro & Flash 模型现已通过 Gemini Code Assist 全面上市,VS Code 智能体模式推出预览版
Google 宣布 Gemini 2.5 Pro 和 Gemini 2.5 Flash 模型现已通过 Gemini Code Assist 向所有用户层级全面上市,并推出了 VS Code 内部通道的智能体模式预览。
15
7月
趋势·来源 · www.reddit.com·2026/07/15
Kimi K3、Deepseek V4 全面上市,新 Liquid、Mistral 模型发布,GLM 5.5 传闻八月登场,开源 AI 生态加速发展
开放权重 AI 生态系统正快速发展,Kimi K3、Deepseek V4 全面上市,新的 Liquid 和 Mistral 模型即将推出,并有传闻称 GLM 5.5 将于八月问世。
15
7月
趋势·来源 · prismml.com·2026/07/15
Bonsai 27B:可在手机上运行的 27B 级模型
Bonsai 27B 是一款新型 27B 级模型,实现了在手机上高效运行的显著成就。
15
7月
趋势·来源 · www.reddit.com·2026/07/15
社区讨论“最佳本地 VLM”:评估面临挑战,工具尚不成熟
关于“2026 年 7 月最佳本地 VLM”的社区讨论指出,由于基准不可靠、工具不成熟以及固有的随机性,评估这些模型目前存在困难。
15
7月
趋势·来源 · arxiv.org·2026/07/15
KV 缓存压缩研究:系统比较 Turbo-Quant 与 SpectralQuant
新研究系统地比较了 Turbo-Quant 和 SpectralQuant 两种 KV 缓存压缩技术,并评估了各种非主导方案。