中文

基于特征选择与聚合的实用视频目标检测

计算机视觉与模式识别 2024-07-30 v1

摘要

与静止图像目标检测不同,视频目标检测(VOD)需要尤其关注目标外观在不同帧之间的高跨帧变化,以及某些帧中出现的各种退化。从原理上说,对视频某一帧的检测可以从其他帧的信息中受益。因此,如何有效地跨越不同帧聚合特征是关键问题。大多数当代聚合方法针对两阶段检测器设计,由于双阶段的特性而导致高计算成本。另一方面,尽管一阶段检测器在处理静态图像方面取得了持续进展,但其针对VOD的适用性尚未得到充分探索。为解决上述问题,本研究提出一种非常简单且高效的特征选择与聚合策略,在计算开销有限的情况下获得显著的精度提升。具体而言,为了削减一阶段目标检测器因稠密预测特征造成的大量计算和内存消耗,我们首先从稠密预测图中浓缩候选特征。然后,评估目标帧与其参考帧之间的关系,以引导聚合。进行了全面实验和消融研究,以验证我们设计的有效性,并展示其在有效性和效率方面优于其他前沿VOD方法。值得注意的是,我们的模型在单个3090 GPU上在ImageNet VID数据集上达到了\emph{新的纪录性能,即92.9% AP50,超过30 FPS},使其成为大规模或实时应用的有力选择。该实现简单易访问,地址为\url{https://github.com/YuHengsss/YOLOV}。

关键词

引用

@article{arxiv.2407.19650,
  title  = {Practical Video Object Detection via Feature Selection and Aggregation},
  author = {Yuheng Shi and Tong Zhang and Xiaojie Guo},
  journal= {arXiv preprint arXiv:2407.19650},
  year   = {2024}
}