中文

FAQ:面向基于Transformer的视频目标检测器的特征聚合查询

计算机视觉与模式识别 2023-03-21 v2

摘要

视频目标检测需要解决在图像域中极少出现的特征退化情况。一种解决方案是利用时序信息并融合相邻帧的特征。随着基于Transformer的目标检测器在图像域任务上取得更优性能,近期工作开始将这些方法扩展至视频目标检测。然而,现有基于Transformer的视频目标检测器仍沿用经典目标检测器的相同流程,例如通过聚合来增强目标特征表示。在本工作中,我们从不同视角看待视频目标检测:具体而言,我们通过聚合来提升基于Transformer模型的查询质量。为实现该目标,我们首先提出一个朴素查询聚合模块,根据相邻帧的特征对查询进行加权平均;随后将该朴素模块扩展为更实用的版本,根据输入帧的特征生成并聚合查询。大量实验结果验证了所提方法的有效性:在具有挑战性的ImageNet VID基准上,集成我们所提模块后,当前最先进的基于Transformer的目标检测器在mAP上提升超过2.4%,在AP50上提升超过4.2%。

关键词

引用

@article{arxiv.2303.08319,
  title  = {FAQ: Feature Aggregated Queries for Transformer-based Video Object Detectors},
  author = {Yiming Cui and Linjie Yang},
  journal= {arXiv preprint arXiv:2303.08319},
  year   = {2023}
}

备注

12 pages, 4 figures