DETR++:驯服你的多尺度检测 Transformer
计算机视觉与模式识别
2022-06-08 v1 机器学习
摘要
自 AlexNet 在 ImageNet 分类中取得成功以来,卷积神经网络(CNN)一直主导着检测领域 [12]。随着 Transformer [27] 在自然语言处理中的全面革新,Carion 等人 [2] 引入了基于 Transformer 的检测方法,即 DETR。然而,由于 Transformer 自注意力机制中的二次复杂度,DETR 始终无法像现有基于 CNN 的检测器那样融合多尺度特征,导致在小目标检测上结果欠佳。为缓解此问题并进一步提升 DETR 性能,本工作中我们探究了融合多尺度特征的不同方法,发现双向特征金字塔(BiFPN)在与 DETR 结合时最能进一步提升检测精度。基于该发现,我们提出 DETR++,一种在 MS COCO 2017 上比现有基线提升 1.9% AP、在 RICO 图标检测上提升 11.5% AP、在 RICO 布局提取上提升 9.1% AP 的新架构。
引用
@article{arxiv.2206.02977,
title = {DETR++: Taming Your Multi-Scale Detection Transformer},
author = {Chi Zhang and Lijuan Liu and Xiaoxue Zang and Frederick Liu and Hao Zhang and Xinying Song and Jindong Chen},
journal= {arXiv preprint arXiv:2206.02977},
year = {2022}
}
备注
T4V: Transformers for Vision workshop @ CVPR 2022