中文

面向图像与视频中实时精确目标检测的联合锚点-特征细化方法

计算机视觉与模式识别 2020-03-16 v6 机器人学

摘要

目标检测已被深入研究多年,但针对真实场景的快速精确检测仍是一个非常具有挑战性的问题。为克服单阶段检测器的缺陷,我们旨在实时精确检测静态与时序场景中的目标。首先,设计了一种作为双重细化机制的新型锚点偏移检测,其包含锚点细化、特征位置细化以及可变形检测头。该新检测模式能够同时执行两步回归并捕获准确的目标特征。基于锚点偏移检测,我们构建了用于高性能静态检测的双重细化网络(DRNet),其中进一步设计了多可变形头以利用上下文信息描述目标。对于视频中的时序检测,通过跨时间传播细化信息,开发了时序细化网络(TRNet)与时序双重细化网络(TDRNet)。我们还提出了一种软细化策略,以在时间上使目标运动与先前的细化相匹配。我们所提方法在 PASCAL VOC、COCO 和 ImageNet VID 数据集上进行了评估。在静态与时序检测上的大量对比验证了 DRNet、TRNet 和 TDRNet 的优越性。因此,我们开发的方法以相当快的速度运行,同时实现了显著提升的检测精度,即在 VOC 2007 上 84.4% mAP、VOC 2012 上 83.6% mAP、VID 2017 上 69.4% mAP 以及 COCO 上 42.4% AP。最终,我们的方法取得了令人鼓舞的结果,并被应用于自主系统的在线水下目标检测与抓取。代码已公开于 https://github.com/SeanChenxy/TDRN。

关键词

引用

@article{arxiv.1807.08638,
  title  = {Joint Anchor-Feature Refinement for Real-Time Accurate Object Detection in Images and Videos},
  author = {Xingyu Chen and Junzhi Yu and Shihan Kong and Zhengxing Wu and Li Wen},
  journal= {arXiv preprint arXiv:1807.08638},
  year   = {2020}
}