基于空间调制协同注意力的 DETR 快速收敛方法
计算机视觉与模式识别
2021-08-21 v1
摘要
近期提出的检测Transformer(Detection Transformer, DETR)模型成功地将Transformer应用于目标检测,并取得了与两阶段目标检测框架(如Faster-RCNN)相当的性能。然而,DETR存在收敛缓慢的问题。从零开始训练DETR需要500个epoch才能达到高准确率。为加速其收敛,我们提出了一种简单而有效的改进DETR框架的方案,即空间调制协同注意力(Spatially Modulated Co-Attention, SMCA)机制。SMCA的核心思想是在DETR中通过约束协同注意力响应在初始估计的边界框位置附近保持较高,从而进行位置感知的协同注意力。我们提出的SMCA通过替换解码器中原始的协同注意力机制并保持DETR中其他操作不变,提高了DETR的收敛速度。此外,通过将多头和尺度选择注意力设计集成到SMCA中,我们完整的SMCA相比基于膨胀卷积骨干网的DETR可实现更好的性能(在108个epoch达到45.6 mAP,而后者在500个epoch达到43.3 mAP)。我们在COCO数据集上进行了广泛的消融实验以验证SMCA。代码发布于 https://github.com/gaopengcuhk/SMCA-DETR 。
引用
@article{arxiv.2108.02404,
title = {Fast Convergence of DETR with Spatially Modulated Co-Attention},
author = {Peng Gao and Minghang Zheng and Xiaogang Wang and Jifeng Dai and Hongsheng Li},
journal= {arXiv preprint arXiv:2108.02404},
year = {2021}
}
备注
Accepted by ICCV2021. arXiv admin note: substantial text overlap with arXiv:2101.07448