Anchor DETR:基于Transformer的目标检测查询设计
计算机视觉与模式识别
2022-01-05 v2
摘要
本文中,我们针对基于 transformer 的目标检测提出一种新颖的查询设计。在以往的基于 transformer 的检测器中,目标查询是一组学习到的嵌入。然而,每个学习到的嵌入没有明确的物理意义,且我们无法解释其将聚焦于何处。由于每个目标查询的预测槽位没有特定模式,其难以优化。换言之,每个目标查询不会聚焦于特定区域。为解决这些问题,在我们的查询设计中,目标查询基于锚点,锚点广泛用于基于 CNN 的检测器中。因此每个目标查询聚焦于锚点附近的目标。此外,我们的查询设计可在同一位置预测多个目标,以解决“一个区域、多个目标”的困难。另外,我们设计了一种注意力变体,其能在降低内存开销的同时取得与 DETR 中标准注意力相似或更好的性能。得益于该查询设计与注意力变体,我们所提出的称为 Anchor DETR 的检测器能够以少 10 的训练轮数取得更好性能且推理更快。例如,在使用 ResNet50-DC5 特征训练 50 轮时,其在 MSCOCO 数据集上以 19 FPS 取得 44.2 AP。在 MSCOCO 基准上的大量实验证明了所提方法的有效性。代码见 \url{https://github.com/megvii-research/AnchorDETR}。
引用
@article{arxiv.2109.07107,
title = {Anchor DETR: Query Design for Transformer-Based Object Detection},
author = {Yingming Wang and Xiangyu Zhang and Tong Yang and Jian Sun},
journal= {arXiv preprint arXiv:2109.07107},
year = {2022}
}
备注
Accepted to AAAI 2022