中文

MR2-ByteTrack:基于 CNN 和 Transformer 的视频目标检测,用于 AI 增强嵌入式视觉传感器节点

计算机视觉与模式识别 2026-05-18 v1 人工智能 图像与视频处理

摘要

现代智能视觉传感器需要在设备上进行智能处理视频流,因为云计算常常不可行 due to 带宽、延迟和隐私限制。然而,这些感知系统通常依赖功耗极低的微控制器 (MCU),内存和计算有限,使得需要特征存储或多帧缓冲的常规视频目标检测方法不可行。为解决这一挑战,我们引入多分辨率评分 ByteTrack (MR2-ByteTrack),一种为 MCU 级嵌入式视觉节点量身定制的视频目标检测 (VOD) 方法。MR2-ByteTrack 通过在全分辨率和低分辨率推理之间交替来降低计算成本,同时通过 ByteTrack 将检测结果跨帧链接起来,并通过 Rescore 算法应用概率并集规则来聚合检测置信度得分,以纠正误分类。我们将该方法应用于 CNN 基础检测器和 Transformer 基础模型,展示其在具有根本不同空间处理的体系结构之间的通用性。在 ImageNetVID 上进行实验,MR2-ByteTrack 在保持准确性的同时,将乘法-累加运算量降低最高可达 CNN 的 53\% 和 Transformer 的 32\%。在部署于 GAP9,一种超低功耗 RISC-V 多核 MCU 时,我们的方法相比仅处理全分辨率图像可实现最高 55\% 的能源节省,使首个在 MCU 级嵌入式视觉节点上实现实时 Transformer 级 VOD 成为可能。代码可在 https://github.com/Bomps4/Multi_Resolution_Rescored_ByteTrack/tree/IEEE_Access 获得

关键词

引用

@article{arxiv.2605.15423,
  title  = {MR2-ByteTrack: CNN and Transformer-based Video Object Detection for AI-augmented Embedded Vision Sensor Nodes},
  author = {Luca Bompani and Manuele Rusci and Luca Benini and Daniele Palossi and Francesco Conti},
  journal= {arXiv preprint arXiv:2605.15423},
  year   = {2026}
}