← GitHub 高星项目/carloslfu/slotstream
在
carloslfu/

在 Mac 上流式运行 105GB 大模型

这个项目的思路非常巧妙:它试图让内存有限的 Mac 也能跑起 105GB 的庞大模型。具体来说,它通过从 SSD 流式加载 Qwen3.8-Flash-Next(一个 125B 的混合专家模型),并仅仅将最活跃的专家网络缓存到内存中,从而使得 16GB 到 64GB 内存的 Mac 也能完成推理。 它完全基于 Swift、MLX 和 Metal 开发,没有任何 Python 依赖,且支持完全离线运行。项目还兼容 Claude Code、Codex 以及 OpenAI 客户端。这种通过存储换内存的工程实践,为本地运行超大模型提供了一个有趣的解法。

Swift高潜项目潜龙编辑甄选
★ Stars
413
GitHub stars
⑂ Forks
28
Forked repos
⊙ Rank
No. 5
Editor rank
Activity
活跃
发布于 2026-10-04T21:11:08.000Z
编辑评介README快速上手Releases
潜龙评分
4.6/ 5.0
代码质量4.7
文档完善4.5
社区活跃4.4
上手难度4.2

在 Mac 上流式运行 105GB 大模型 最值得关注的地方,是它围绕真实开发场景提供了清晰的工程入口。这个项目的思路非常巧妙:它试图让内存有限的 Mac 也能跑起 105GB 的庞大模型。具体来说,它通过从 SSD 流式加载 Qwen3.8-Flash-Next(一个 125B 的混合专家模型),并仅仅将最活跃的专家网络缓存到内存中,从而使得 16GB 到 64GB 内存的 Mac 也能完成推理。 它完全基于 Swift、MLX 和 Metal 开发,没有任...

优点
+主题明确,便于快速判断适用场景
+社区关注度高,持续维护概率更大
+可作为同类技术选型的参考样本
不足
-具体成熟度仍需结合 README 与 issue 验证
-生产接入前需要自行评估许可与维护节奏

适用场景

如果你正在评估 高潜项目 方向,这个项目适合放入候选清单。它的 Star、Fork 与主题信息能够帮助你快速判断社区热度,再结合官方仓库文档进行技术验证。

潜龙 QianLong · 中文 AI 内容与工具平台