中文

YOLOV:使静态图像目标检测器在视频目标检测中表现出色

计算机视觉与模式识别 2023-03-07 v2

摘要

视频目标检测(VID)具有挑战性,因为目标外观变化大且某些帧中存在多样的退化。从积极的一面看,与静态图像相比,视频中某一帧的检测可从其他帧获得支持。因此,如何跨不同帧聚合特征对 VID 问题至关重要。大多数现有聚合算法是为两阶段检测器定制的。然而,由于其两阶段性质,这些检测器通常计算开销大。本工作提出了一种简单而有效的策略来解决上述顾虑,其以边际开销换取准确率的显著提升。具体地,不同于传统两阶段流程,我们在一阶段检测后筛选重要区域,以避免处理大量低质量候选。此外,我们评估目标帧与参考帧之间的关系以引导聚合。我们进行了大量实验和消融研究来验证我们设计的有效性,并揭示了其在效果与效率上优于其他最先进的 VID 方法。我们基于 YOLOX 的模型能取得颇具前景的性能(例如,在单张 2080Ti GPU 上于 ImageNet VID 数据集以超过 30 FPS 达到 87.5% AP50),使其对大规模或实时应用具有吸引力。实现简单,我们已在 \url{https://github.com/YuHengsss/YOLOV} 提供演示代码与模型。

关键词

引用

@article{arxiv.2208.09686,
  title  = {YOLOV: Making Still Image Object Detectors Great at Video Object Detection},
  author = {Yuheng Shi and Naiyan Wang and Xiaojie Guo},
  journal= {arXiv preprint arXiv:2208.09686},
  year   = {2023}
}