大家好,我是何三,独立开发者
最近刷到乐鑫(Espressif)刚开源的一个项目,叫 ESP-Vision。
看完我就愣住了。
怎么说呢,就是……就是那种"你小子怎么不早开源"的感觉。
这东西干的事很简单:在几十块钱的 ESP32-P4 芯片上跑计算机视觉。人脸检测、物体识别、视频推流,一条龙。而以前你要做同样的事,至少得买块树莓派(¥300+)或者 Jetson Nano(¥1000+)。

成本直接砍到十分之一,甚至二十分之一。
而且它还能在浏览器里写代码、编译、烧录一条龙。对,你没看错——Web IDE。
为什么以前嵌入式视觉这么折腾?
说白了,传统玩法是这样的:你得先配一套 C/C++ 交叉编译环境,折腾半天才能让摄像头输出一帧画面。然后自己手撸 AI 推理代码,再想办法把视频流推出去。整个过程下来,光环境配置就能劝退一半的人。
ESP-Vision 的思路不一样。
它把摄像头采集、图像处理、视频编解码、网络传输、AI 推理这些东西——全部封装成统一的 Python API。你要做的就是:
from esp_vision import Camera, AI, Stream
# 开摄像头
cam = Camera()
# 人脸检测
result = cam.detect('face')
# 视频推流
Stream(cam).start()
对,就三行。三行代码,摄像头开了,AI 跑了,视频推到浏览器了。
之前有个朋友跟我吐槽,说他用 C 写摄像头驱动,光调 MIPI 接口就花了两个星期。我说你看看这个,他看完沉默了。

说实话,ESP32-P4 这颗芯片本身也挺有意思的。它是乐鑫目前最强的 SoC,带了一个叫 ESP-DL 的深度学习加速单元,专门优化边缘端的推理性能。不是简单地用 CPU 硬算,而是有硬件加速的。
原理大概是这样——我也没完全搞懂所有细节——就是它把常见的 CNN 算子(卷积、池化、全连接)在硬件层面做了优化,跑 MobileNet 这类轻量模型的时候,帧率能做到实时。有懂的大佬欢迎指正。
说到这我突然想到一个事儿。
前阵子我折腾 Home Assistant 的摄像头接入,想给门口的猫做个自动识别。搞来搞去,树莓派连着 USB 摄像头,功耗 5W,还得配个散热片。现在想想,要是用 ESP-Vision,一个指甲盖大的芯片就能搞定,功耗不到 1W,直接焊到门禁上就行了……这差距,啧。
上手试试?
你只需要一块 ESP32-P4X-EYE 开发板(乐鑫官方出的,几十块钱),然后执行:
git clone --recursive https://github.com/espressif/esp-vision.git esp-vision
cd esp-vision
idf.py --board ESP32_P4X_EYE -p /dev/ttyACM0 build flash monitor
编译烧录一气呵成。接上摄像头,就能看到实时的人脸检测画面了。
如果你不想装任何环境,乐鑫还搞了个 Web IDE(ide.vision.espressif.com),浏览器里打开就能写代码、编译、烧录。这个我是真的吹爆——以前搞嵌入式哪见过这阵仗?
说到同类工具,如果你对边缘 AI 感兴趣,我之前还写过一篇关于 OpenCV 新版本 的文章,在 PC 端做视觉处理还是得靠它。关注后回复「工具」可以获取完整合集。
另外如果你做 IoT 比较多,乐鑫的 ESP-RainMaker 也值得看看,搞设备联网挺方便的。
项目地址在这里,自己去 Star 一下:
GitHub: https://github.com/espressif/esp-vision 文档: https://docs.espressif.com/projects/esp-vision/zh_CN/latest/
这项目才刚开源没多久,Star 数还不高,但乐鑫的团队更新很勤快。趁早入手,等火起来你就是第一批玩家了。
装不装都行,看你自己需求。但如果你刚好有个摄像头吃灰,手里又有块 ESP32 开发板——别犹豫了,干就完了。
本文使用 MGO 编辑并发布
关注"何三笔记",回复"mgo" 免费下载使用