Conditional DETR V2:基于框查询的高效检测 Transformer
计算机视觉与模式识别
2022-07-20 v1
摘要
在本文中,我们关注 Detection Transformer (DETR),一种基于 transformer 编码器-解码器架构且无手工后处理(如 NMS)的端到端目标检测方法。受 Conditional DETR(一种具有快速训练收敛性的改进 DETR,其为内部解码器层提出了框查询(原称空间查询))的启发,我们将目标查询重构为框查询的形式,即参考点的嵌入与相对于参考点的框的变换的组合。这一重构表明了 DETR 中的目标查询与 Faster R-CNN 中广泛研究的锚框之间的联系。此外,我们从图像内容中学习框查询,在保持快速训练收敛的同时进一步提升了 Conditional DETR 的检测质量。另外,我们采用轴向自注意力以节省内存开销并加速编码器。所得检测器称为 Conditional DETR V2,取得了优于 Conditional DETR 的结果,节省了内存开销且运行更高效。例如,对于 DC-ResNet- 骨干网络,我们的方法在 COCO 集上以 FPS 达到 AP,与 Conditional DETR 相比,其运行速度快 ,节省 \% 的整体内存开销,并提升 AP 分数。
引用
@article{arxiv.2207.08914,
title = {Conditional DETR V2: Efficient Detection Transformer with Box Queries},
author = {Xiaokang Chen and Fangyun Wei and Gang Zeng and Jingdong Wang},
journal= {arXiv preprint arXiv:2207.08914},
year = {2022}
}