FFAVOD:面向视频目标检测的特征融合架构
计算机视觉与模式识别
2021-09-16 v1
摘要
视频的连续帧之间存在大量冗余。目标检测器通常一次只对单幅图像产生检测结果,不具备利用该冗余的能力。同时,许多目标检测应用都处理视频,包括智能交通系统、高级驾驶辅助系统和视频监控。我们的工作旨在利用视频帧之间的相似性来产生更好的检测。我们提出 FFAVOD,即面向视频目标检测的特征融合架构(feature fusion architecture for video object detection)。我们首先引入一种新颖的视频目标检测架构,使网络能够在相邻帧之间共享特征图。其次,我们提出一个特征融合模块,学习合并特征图以增强它们。我们表明,使用所提架构和融合模块可以提升三个基础目标检测器在两个包含运动道路使用者序列的目标检测基准上的性能。此外,为了进一步提升性能,我们提出对 SpotNet 注意力模块的一项改进。在改进后的 SpotNet 检测器上使用我们的架构,我们在 UA-DETRAC 公开基准以及 UAVDT 数据集上取得了当前最优(state-of-the-art)性能。代码见 https://github.com/hu64/FFAVOD。
引用
@article{arxiv.2109.07298,
title = {FFAVOD: Feature Fusion Architecture for Video Object Detection},
author = {Hughes Perreault and Guillaume-Alexandre Bilodeau and Nicolas Saunier and Maguelonne Héritier},
journal= {arXiv preprint arXiv:2109.07298},
year = {2021}
}
备注
Accepted for publication in Pattern Recognition Letters