中文

Conditional DETR V2:基于框查询的高效检测 Transformer

计算机视觉与模式识别 2022-07-20 v1

摘要

在本文中,我们关注 Detection Transformer (DETR),一种基于 transformer 编码器-解码器架构且无手工后处理(如 NMS)的端到端目标检测方法。受 Conditional DETR(一种具有快速训练收敛性的改进 DETR,其为内部解码器层提出了框查询(原称空间查询))的启发,我们将目标查询重构为框查询的形式,即参考点的嵌入与相对于参考点的框的变换的组合。这一重构表明了 DETR 中的目标查询与 Faster R-CNN 中广泛研究的锚框之间的联系。此外,我们从图像内容中学习框查询,在保持快速训练收敛的同时进一步提升了 Conditional DETR 的检测质量。另外,我们采用轴向自注意力以节省内存开销并加速编码器。所得检测器称为 Conditional DETR V2,取得了优于 Conditional DETR 的结果,节省了内存开销且运行更高效。例如,对于 DC55-ResNet-5050 骨干网络,我们的方法在 COCO valval 集上以 16.416.4 FPS 达到 44.844.8 AP,与 Conditional DETR 相比,其运行速度快 1.6×1.6\times,节省 7474\% 的整体内存开销,并提升 1.01.0 AP 分数。

关键词

引用

@article{arxiv.2207.08914,
  title  = {Conditional DETR V2: Efficient Detection Transformer with Box Queries},
  author = {Xiaokang Chen and Fangyun Wei and Gang Zeng and Jingdong Wang},
  journal= {arXiv preprint arXiv:2207.08914},
  year   = {2022}
}