基于Transformer的高效无解码器目标检测
计算机视觉与模式识别
2022-06-20 v4
摘要
视觉Transformer(ViT)正在改变目标检测方法的前景。在检测中使用ViT的一种自然方式是用基于Transformer的主干网络替换基于CNN的主干网络,这种做法直接且有效,但代价是带来了可观的推理计算负担。更精细的用法是DETR系列,它消除了目标检测中对许多手工设计组件的需求,但引入了一个需要极长时间才能收敛的解码器。因此,基于Transformer的目标检测无法在大规模应用中占据优势。为克服这些问题,我们首次提出了一种新颖的无需解码器、完全基于Transformer(DFFT)的目标检测器,在训练和推理阶段均实现高效率。我们通过围绕两个切入点将目标检测简化为仅含编码器的单级基于锚点的密集预测问题:1)消除训练低效的解码器,并利用两个强编码器来保持单级特征图预测的精度;2)以有限的计算资源探索用于检测任务的低级语义特征。特别地,我们设计了一种新颖的轻量级面向检测的Transformer主干网络,基于精心构思的消融研究高效地捕获具有丰富语义的低级特征。在MS COCO基准上的大量实验表明,DFFT_SMALL以28%的计算成本降低和超过倍的训练轮数减少,比DETR高出2.5% AP。与前沿的基于锚点的检测器RetinaNet相比,DFFT_SMALL在削减70%计算成本的同时获得了超过5.5% AP的提升。
引用
@article{arxiv.2206.06829,
title = {Efficient Decoder-free Object Detection with Transformers},
author = {Peixian Chen and Mengdan Zhang and Yunhang Shen and Kekai Sheng and Yuting Gao and Xing Sun and Ke Li and Chunhua Shen},
journal= {arXiv preprint arXiv:2206.06829},
year = {2022}
}
备注
Update metadata, 10 pages