中文

面向YOLO目标检测视频的轻量级多帧集成

计算机视觉与模式识别 2025-06-26 v1 机器人学

摘要

现代基于图像的对象检测模型(如YOLOv7)主要独立处理单个帧,忽略了视频中天然存在的有价值的时序信息。而现有的视频检测方法往往引入复杂的时序模块,显著增加模型规模和计算复杂度。在实际应用中,如监控和自动驾驶,运动模糊、遮挡和突变的外观变化等瞬时挑战会严重降低单帧检测性能。为此,我们提出一种简单却高效的策略:将多个连续帧堆叠作为输入喂给YOLO-based检测器,仅对对应单个目标帧的输出进行监督。该方法以最小修改现有架构的方式利用时序信息,保持简洁性、计算效率和实时推理能力。在挑战性的MOT20Det和我们自建的BOAT360数据集上的广泛实验表明,我们的方法在检测鲁棒性方面取得显著提升,尤其是针对轻量级模型,有效缩小了紧凑型和重型检测网络之间的差距。此外,我们贡献了一个BOAT360基准数据集,包含标注好的鱼眼视频序列,来支持多帧视频目标检测在挑战性真实场景中的后续研究。

关键词

引用

@article{arxiv.2506.20550,
  title  = {Lightweight Multi-Frame Integration for Robust YOLO Object Detection in Videos},
  author = {Yitong Quan and Benjamin Kiefer and Martin Messmer and Andreas Zell},
  journal= {arXiv preprint arXiv:2506.20550},
  year   = {2025}
}

备注

Submitted to ECMR 2025