中文

DETR无需多尺度或局部性设计

计算机视觉与模式识别 2023-08-04 v1

摘要

本文提出了一种改进的DETR检测器,保持其“朴素”特性:使用单尺度特征图与全局交叉注意力计算,不施加特定局部性约束,这与先前领先的基于DETR的检测器形成对比,后者将多尺度与局部性的架构归纳偏置重新引入解码器。我们表明,在朴素设计中,两项简单技术出人意料地有效,弥补了多尺度特征图与局部性约束的缺失。第一项是在交叉注意力公式中加入框到像素相对位置偏置(BoxRPB)项,它良好地引导每个查询关注相应目标区域,同时提供编码灵活性。第二项是基于掩码图像建模(MIM)的骨干预训练,其有助于学习具有细粒度定位能力的表征,并被证明对弥补对多尺度特征图的依赖至关重要。通过结合这些技术与近期在训练和问题构建上的进展,改进的“朴素”DETR相较原始DETR检测器展现出卓越提升。借助Object365数据集进行预训练,在使用Swin-L骨干时取得了63.9 mAP精度,与严重依赖多尺度特征图和基于区域特征提取的当前最优检测器极具竞争力。代码见 https://github.com/impiga/Plain-DETR 。

关键词

引用

@article{arxiv.2308.01904,
  title  = {DETR Doesn't Need Multi-Scale or Locality Design},
  author = {Yutong Lin and Yuhui Yuan and Zheng Zhang and Chen Li and Nanning Zheng and Han Hu},
  journal= {arXiv preprint arXiv:2308.01904},
  year   = {2023}
}

备注

To be published in ICCV2023