中文

面向微控制器的 WebSerial 视觉训练:基于浏览器的嵌入式 CNN 训练器

计算机视觉与模式识别 2026-04-28 v1 机器学习

摘要

本文提出了 webmcu-vision-web,一个单文件、零安装的浏览器应用程序,用于在面向微控制器的 TinyML 视觉模型训练和部署。其针对 Seeed Studio XIAO ESP32-S3 Sense(XIAO ML Kit,$15--40 USD)进行了端到端的模型训练。作为 Paper 1 [1] 所述 Arduino 固件的浏览器端伴随程序,webmcu-vision-web 提供了一个在本地完成的私有机器学习管道,涵盖固件烧录、图像收集、CNN 训练、权重导出及实时激活可视化,无需任何软件安装,仅需 Chromium 基于浏览器。该系统面向需要在确切的部署条件下训练任务特定视觉分类器的教育者、小型企业和研究人员。关键功能包括:通过 esptool-js 实现的浏览器固件烧录;支持图像预览和内联编辑的 SD 卡文件浏览器;config.json 实时同步,实现无需重新编译的超参数调节;Webcam 和 ESP32 OV2640 相机图像采集;TensorFlow.js CNN 训练完成三类任务(约每类 30 张图片,20 个 epoch)约需 1 分钟浏览器端,而非 9 分钟设备端,使收集-训练-部署完整周期在 10 分钟内完成;权重导出为 myWeights.bin 和 myWeights.h;混淆矩阵;以及在推理期间从 ESP32 流式传输的实时 Conv2 激活热图。整个过程中数据无需离开本地机器。针对三类参考问题(0Blank、1Cup、2Pen)的五次一致性评估显示收敛稳定,报告平均准确率和标准差;所有制品均在下方提供的仓库链接处发布。该仓库是 LLM 辅助适配新硬件和新任务的活跃模板。所有源代码均采用 MIT 许可证发布于 https://github.com/webmcu-ai/webmcu-vision-web。

关键词

引用

@article{arxiv.2604.22834,
  title  = {WebSerial Vision Training for Microcontrollers: A Browser-Based Companion to On-Device CNN Training},
  author = {Jeremy Ellis},
  journal= {arXiv preprint arXiv:2604.22834},
  year   = {2026}
}

备注

29 pages, 16 figures, 5 tables. Paper 2 of the webmcu-ai series. All source code and supplemental results available at: https://github.com/webmcu-ai/webmcu-vision-web