用于快速训练收敛的条件 DETR
计算机视觉与模式识别
2023-10-02 v3
摘要
近年来提出的 DETR 方法将 transformer 编码器与解码器架构应用于目标检测,并取得了令人瞩目的性能。本文针对其训练收敛慢这一关键问题,提出一种用于快速 DETR 训练的条件交叉注意力机制。我们的方法动机在于:DETR 中的交叉注意力高度依赖内容嵌入来定位四个端点并预测边界框,这加大了对高质量内容嵌入的需求,从而增加了训练难度。我们提出的方法名为条件 DETR,它从解码器嵌入中学习条件空间查询,用于解码器的多头交叉注意力。其好处在于,通过条件空间查询,每个交叉注意力头都能关注到包含不同区域(例如某个目标端点或目标框内区域)的条带。这缩小了用于目标分类与边界框回归中定位不同区域的空间范围,从而放宽了对内容嵌入的依赖并简化了训练。实验结果表明,条件 DETR 对于骨干网络 R50 和 R101 收敛速度加快 6.7 倍,对于更强骨干网络 DC5-R50 和 DC5-R101 加快 10 倍。代码见 https://github.com/Atten4Vis/ConditionalDETR。
引用
@article{arxiv.2108.06152,
title = {Conditional DETR for Fast Training Convergence},
author = {Depu Meng and Xiaokang Chen and Zejia Fan and Gang Zeng and Houqiang Li and Yuhui Yuan and Lei Sun and Jingdong Wang},
journal= {arXiv preprint arXiv:2108.06152},
year = {2023}
}
备注
Accepted by ICCV 2021. The first two authors share first authorship, and the order was determined by rolling dice