中文

DFA:面向高效视频目标检测的动态特征聚合

计算机视觉与模式识别 2022-10-04 v1

摘要

视频目标检测是计算机视觉中基础却具挑战性的任务。一种实用方案是利用视频中的时序信息并应用特征聚合来增强每帧中的目标特征。尽管有效,现有方法推理速度始终偏低,因为它们无论输入帧如何都使用固定帧数进行特征聚合。因此,本文旨在提升当前基于特征聚合的视频目标检测器推理速度,同时保持其性能。为实现该目标,我们提出一个朴素动态聚合模块,自适应选择帧进行特征增强。随后,我们将该朴素动态聚合模块扩展为更有效且可重构的可变形版本。最后,我们引入原地蒸馏损失以改进用更少帧聚合的目标表示。大量实验结果验证了所提方法的有效性与高效性:在 ImageNet VID 基准上,集成我们的方法后,FGFA 与 SELSA 的推理速度分别提升 31% 与 76%,同时取得相当的精度表现。

关键词

引用

@article{arxiv.2210.00588,
  title  = {DFA: Dynamic Feature Aggregation for Efficient Video Object Detection},
  author = {Yiming Cui},
  journal= {arXiv preprint arXiv:2210.00588},
  year   = {2022}
}