面向超低功耗MCU的单目深度估计多模态即时学习
计算机视觉与模式识别
2025-12-23 v2
摘要
单目深度估计(MDE)在为超低功耗(ULP)物联网平台启用空间感知应用方面发挥着关键作用。然而,为物联网节点设计的MDE任务深度神经网络参数数量有限,导致当传感器数据在实际场地与训练数据集显著偏移时,精度急剧下降。为解决这一领域迁移问题,我们提出一种多模态即时学习(ODL)技术,部署在集成Greenwaves GAP9微控制器单元(MCU)、80mW单目相机和8×8像素深度传感器的IoT设备上,总功耗约为300mW。在正常工作模式下,该系统将单目图像输入到一个仅含107k参数的PyD-Net模型进行推理。深度传感器通常保持关闭状态以最小化能耗,但在系统置于新环境时,仅在摄像头同时激活时收集伪标签。随后,所有微调任务均在MCU上完成。为优化基于反向传播的即时训练,我们提出一种基于内存的稀疏更新方案,将微调所需内存降至1.2 MB,仅为完整更新的2.2倍,同时保持精度(在KITTI和NYUv2数据集上分别仅下降2%和1.5%)。我们的现场测试首次证明,在IoT节点上执行MDE的ODL可在17.8分钟内完成,将根均方误差从4.9m降至0.6m,仅需3k个在真实场景部署中收集的自标注样本。
引用
@article{arxiv.2512.00086,
title = {Multi-modal On-Device Learning for Monocular Depth Estimation on Ultra-low-power MCUs},
author = {Davide Nadalini and Manuele Rusci and Elia Cereda and Luca Benini and Francesco Conti and Daniele Palossi},
journal= {arXiv preprint arXiv:2512.00086},
year = {2025}
}
备注
14 pages, 9 figures, 3 tables. Associated open-source release available at: https://github.com/idsia-robotics/ultralow-power-monocular-depth-ondevice-learning