大家好,我是何三,独立开发者

50ms 起一个沙箱,暂停只要 100ms,内存还能超卖 9.6 倍。这组数字不是 PPT 上画的饼,是 Kimi K3 训练时真实在跑的生产环境——150 万镜像,一天到晚在线。

AgentENV(AENV),kvcache-ai 开源的 Rust 项目,GitHub 上 3.2k Star(约 3 千),一个月不到冲上来的。官方定位一句话:大规模运行 Agent 环境的分布式平台。说白了,就是给 AI Agent 批量开"小房间"用的。

它到底解决了什么?

现在做 Agent 的人都知道,跑一个 Agent 任务,动不动就要起虚拟机。传统 VM 启动按分钟算,内存还死贵。你想想,Kimi K3 那种万亿参数的模型做强化学习,一次要并行开多少环境?几万?几十万?用传统虚拟机那套,光启动时间就能把人等哭。

AENV 的路子不一样。它底层用 Firecracker——就是 AWS Lambda 那个微虚拟机技术——再加 overlaybd 按需加载镜像。镜像不用整个拷下来,用到哪块拉哪块,本地磁盘只当缓存,热数据留着,冷数据踢掉。

说白了,以前你得准备一整块硬盘把所有镜像塞进去,现在本地那点缓存就够了,剩下的全在远端,用到才拉。

快照才是灵魂。

AENV 的快照是增量的,内存和文件系统一起快照,哪怕磁盘疯狂写入,100ms 内也能完成。一个跑着的环境,随时能 fork 出好几个独立沙箱,并行跑 Agent 任务。跑完暂停,内存还给宿主机,新任务来了再恢复,50ms 就绪。

跑题说一句,这个"暂停-恢复"的思路,让我想起以前玩模拟器时的即时存档。玩到一半存档,下次打开接着玩,进度一分不差。AENV 干的事差不多,只不过对象从游戏换成了整个 Linux 环境,规模从一台变成上万台。

内存这块是真狠。它靠 ballooning 把客户机"用不上"的内存收回来还给宿主机,生产环境做到了 9.6x 超卖——一台机器,按 9.6 台的内存算着用。怎么做到的呢?环境越多、跑得越久、分化越大,能回收的空间就越多。说实话,这块我也没完全搞懂,9.6 倍的超卖比在虚拟化领域真不是随便说说的数字,有懂的大佬欢迎指正。

AgentENV 快照沙箱原理

上手也简单。前提是 Linux 内核 6.8+,有 /dev/kvm。装起来一条命令:

curl -fsSL https://raw.githubusercontent.com/kvcache-ai/AgentENV/main/scripts/install.sh | sudo bash
sudo systemctl start aenv

然后拉个镜像,起沙箱:

aenv pull ubuntu:22.04 --name ubuntu
aenv start ubuntu            # 起沙箱并进入交互 shell

就这么朴实无华。跑起来后你还能 aenv pauseaenv resumeaenv exec,甚至给沙箱设 TTL 超时回收,防止 Agent 跑飞了没人管。

AgentENV 上手 CLI

最骚的是 E2B 兼容。E2B 是现在 Agent 沙箱圈最火的付费服务之一,AENV 直接暴露一套 E2B 兼容的 HTTP API,你把 E2B_API_URL 指到自己的服务器,原来用 E2B Python/TS SDK 的代码一行不用改,直接白嫖开源版。这波操作,怎么说呢,就是……就是那种"我不仅要替代你,还要让你迁移零成本"的自信。

不过丑话得说前头。README 里明确警告:当前版本不支持鉴权,别把 API 暴露到公网。这项目现在定位是可信内网或代理后面跑。自己玩可以,想上生产,先想好安全方案。

同类项目的话,E2B 本身值得看(虽然收费),Firecracker 底层技术也值得研究。如果你对这类 Agent 基础设施感兴趣,我此前还整理过《2026 年 GitHub 高性能神器排行榜》,关注后回复「工具」获取。

项目地址:https://github.com/kvcache-ai/AgentENV

一句话总结:Agent 跑多了,虚拟机那套真该换了。50ms 起沙箱、内存超卖 9.6 倍、150 万镜像在线跑——Kimi K3 都用它训练,你还不试试?

本文使用 MGO 编辑并发布

关注"何三笔记",回复"mgo" 免费下载使用