面向视频目标检测的对象感知特征聚合
计算机视觉与模式识别
2020-10-26 v1
摘要
我们提出一种用于视频目标检测(VID)的对象感知特征聚合(OFA)模块。我们的方法受到一个有趣特性的启发:视频级对象感知知识可作为强大的语义先验来帮助目标识别。因此,用此类先验知识增强特征可以有效提升分类与定位性能。为使特征获取更多关于整个视频的内容,我们首先捕获候选框的对象感知知识,并将此类知识与成熟的成对上下文相融合。在 ImageNet VID 数据集上的大量实验结果表明,我们的方法证明了对象感知知识的有效性,使用 ResNet-101 和 ResNeXt-101 分别取得了 83.93% 和 86.09% 的优越 mAP。当进一步配备 Sequence DIoU NMS 时,我们在投稿时取得了已报道的最佳 mAP,分别为 85.07% 和 86.88%。复现我们结果的代码将在录用后发布。
引用
@article{arxiv.2010.12573,
title = {Object-aware Feature Aggregation for Video Object Detection},
author = {Qichuan Geng and Hong Zhang and Na Jiang and Xiaojuan Qi and Liangjun Zhang and Zhong Zhou},
journal= {arXiv preprint arXiv:2010.12573},
year = {2020}
}