中文

用于精确单阶段目标检测的解耦自注意力

计算机视觉与模式识别 2020-12-16 v2

摘要

由于目标检测数据集的规模小于图像识别数据集 ImageNet,迁移学习已成为深度学习目标检测模型的基本训练方法,其会在 ImageNet 数据集上预训练目标检测模型的骨干网络,以提取用于分类与定位子任务的特征。然而,分类任务关注物体的显著区域特征,而定位任务关注物体的边缘特征,因此预训练骨干网络提取的特征与定位任务所用特征之间存在一定偏差。为解决该问题,本文针对单阶段目标检测模型提出了一种解耦自注意力(DSA)模块。DSA 包含两条解耦的自注意力分支,从而可为不同任务提取适宜的特征。它位于 FPN 与子任务的头网络之间,用于基于 FPN 融合特征独立地为不同任务提取全局特征。尽管 DSA 模块的网络结构简单,但能有效提升目标检测性能,且易于嵌入多种检测模型。我们的实验基于代表性的单阶段检测模型 RetinaNet。在 COCO 数据集上,当使用 ResNet50 和 ResNet101 作为骨干网络时,检测性能分别提升 0.4% AP 和 0.5% AP。当在 RetinaNet 中同时应用 DSA 模块与目标置信度任务时,基于 ResNet50 和 ResNet101 的检测性能分别提升 1.0% AP 和 1.4% AP。实验结果表明了 DSA 模块的有效性。代码见:https://github.com/chenzuge1/DSANet.git。

关键词

引用

@article{arxiv.2012.07630,
  title  = {Decoupled Self Attention for Accurate One Stage Object Detection},
  author = {Kehe WU and Zuge Chen and Qi MA and Xiaoliang Zhang and Wei Li},
  journal= {arXiv preprint arXiv:2012.07630},
  year   = {2020}
}

备注

15 pages, 5 figures