大家好,我是何三,独立开发者

25GB 内存的笔记本,跑一个 7440 亿参数的大模型。

你没看错。不是 7B,不是 70B——是 744B。

这个叫 Colibrì 的项目,一周多就在 GitHub 上拿了近 1.8 万 Star(17,784 Star),纯 C 写的推理引擎,单一文件零依赖,把智谱 GLM-5.2 这个 744B 的 MoE 大模型硬生生塞进了消费级电脑里。

说实话,刚看到这个数据的时候,我以为又是标题党。

直到我去翻了一圈它的 benchmark 和社区实测,发现人家是真干出来了。

372GB 的模型,凭什么 25GB 内存就能跑?

这就要说到 MoE(Mixture of Experts)的一个"bug级"特性了。

744B 参数的模型,每次推理一个 token,实际激活的只有大约 40B 参数。而其中真正需要实时切换的,是那 19,456 个"路由专家"——每次 token 只调其中几个。

说白了,这个模型不需要完整塞进内存。它只需要把常用的部分放进去,不常用的放硬盘上,随用随取。

Colibrì 的做法是三级存储架构:

colibrì三级存储架构

  • VRAM(显存):最快但最小,放最热门的专家
  • RAM(内存):中等速度,放"密集参数"部分(注意力层、共享专家等,约 9.9GB)
  • NVMe(固态硬盘):最慢但最大,放那 19,456 个专家(总共约 370GB)

每次模型需要某个专家,就从硬盘"流式"读到内存里算完再丢掉——就像看视频时的边下边播。

原理大概是这样,细节可能有出入——有懂的大佬欢迎指正,我自己也是边看边学。

这个"边下边播"的效果怎么样?

说实话,得看你的硬件。

官方给的 benchmark 数据很诚实,甚至有点过于诚实了:

colibrì性能阶梯

硬件配置 推理速度
6× RTX 5090(全驻留) 5.8 - 6.8 tok/s
128GB CPU 桌面 ~1.8 tok/s
单卡 RTX 5070 Ti 笔记本 1.07 tok/s
25GB 内存的开发机 0.05 - 0.1 tok/s

看到最后一行没?25GB 机器上,每秒只出 0.05 个 token。

就是那种你问它一句,它想了 20 秒才蹦出一个字的程度。

但作者在 README 里大大方方写着——"the proven floor where this project started, and still the honest baseline"(这就是这个项目起步时的地板,也是诚实的基线)。

就冲这份坦诚,我服。

跑起来有多简单?

编译?不需要。下载个 release 解压就能跑。

# 下载预编译包
mkdir colibri && tar xzf colibri-v1.1.0-linux-x86_64.tar.gz -C colibri && cd colibri

# 检查环境
python3 coli info

# 直接跑
COLI_MODEL=/path/to/glm52_i4 ./coli chat

模型文件大概 372GB,得下挺久——作者建议放到 NVMe 固态上,越快的盘体验越好。

你要是有两块 NVMe,还能组个双盘镜像,让两个盘同时读专家,带宽直接翻倍:

COLI_MODEL=/fast/glm52_i4 COLI_MODEL_MIRROR=/second/glm52_i4 ./coli chat

说到这个双盘方案我忍不住想歪个楼——这个思路其实跟某些数据库的 RAID0 有点像,但人家是把模型权重当"流媒体"来分片读取了。这种 JIT 式的权重调度,感觉以后会不会连游戏的贴图资源也能这么搞?算了,扯远了。

这玩意儿真的能用吗?

分场景。

如果你只是想在自己的笔记本上跑跑 744B 模型,体验"拥有前沿大模型"的感觉——那实话实说,每秒 0.05 token 的体验会让你怀疑人生。

但如果你是以下人群:

  • AI 研究者,想分析 MoE 模型内部的路由行为
  • 隐私敏感用户,必须本地运行大模型
  • 硬核玩家,手上有高端 GPU 想榨干性能

那 Colibrì 就是个宝藏。

它的 Web Dashboard 能实时展示 19,456 个专家的存活状态、路由热力图,甚至能看到每个专家"擅长什么话题"(有个叫 Atlas 的 3D 界面,把专家按主题聚类成星系状)。这个功能我真的吹爆——你见过能可视化自己大脑内部运作的大模型吗?

没懂作者为什么这么设计?其实是为了让社区帮忙标注和优化专家路由策略。

如果你对"在有限硬件上跑大模型"这个方向感兴趣,还可以看看:

  • llama.cpp:纯 C/C++ 的 LLaMA 推理引擎,最早普及了"笔记本跑大模型"这个理念
  • Ollama:更友好的用户界面,但底层也是调用的 llama.cpp

Colibrì 和它们最大的区别是:llama.cpp 是让小模型在本地跑,Colibrì 是让超大模型用"流式加载"的方式也在本地跑。一个做减法,一个做加法。

仓库地址:https://github.com/JustVugg/colibri

说点感受

我写完这篇文章的时候,Colibrì 还在以每天近千 Star 的速度疯长。

这个项目打动我的,不只是技术上的巧思——把 744B 的模型塞进 25GB 内存确实很离谱——更是作者在 README 里写的那段话:

Frontier models should not be sealed inside datacenters. colibrì exists so that anyone curious enough can open one up.

前沿模型不应该被锁在数据中心里。

这句话放到国内的大模型语境下,别有一番滋味。开源的模型权重越来越多,真正能让普通人在自己电脑上跑起来的推理引擎,却屈指可数。Colibrì 至少证明了一件事:744B 的模型都能跑,那还有什么是不可能的?

装不装都行,看你自己。但如果你手上正好有块闲置的 1TB NVMe,不妨试试——反正硬盘闲着也是闲着。

本文使用 MGO 编辑并发布

关注"何三笔记",回复"mgo" 免费下载使用