中文

整体迁移预训练 Transformer 编码器-解码器用于视觉目标检测

计算机视觉与模式识别 2023-12-22 v2

摘要

现代目标检测器已利用在大规模数据集上预训练的骨干网络的优势。然而,除骨干网络外,其他组件如检测器头和特征金字塔网络(FPN)仍从零开始训练,这阻碍了充分挖掘表征模型的潜力。在本研究中,我们提出将预训练的 transformer 编码器-解码器整体迁移(imTED)到检测器中,构建一条“完全预训练”的特征提取路径,从而最大化检测器的泛化能力。imTED 与基线检测器的本质区别有两点:(1)将预训练的 transformer 解码器迁移到检测器头,同时从特征提取路径中移除随机初始化的 FPN;(2)定义多尺度特征调制器(MFM)以增强尺度适应性。此类设计不仅显著减少了随机初始化参数,还刻意将检测器训练与表征学习相统一。在 MS COCO 目标检测数据集上的实验表明,imTED 始终以约 2.4 AP 优于同类方法。无需额外技巧,imTED 将少样本目标检测的 SOTA 提升了至多 7.6 AP。代码见 https://github.com/LiewFeng/imTED。

关键词

引用

@article{arxiv.2205.09613,
  title  = {Integrally Migrating Pre-trained Transformer Encoder-decoders for Visual Object Detection},
  author = {Feng Liu and Xiaosong Zhang and Zhiliang Peng and Zonghao Guo and Fang Wan and Xiangyang Ji and Qixiang Ye},
  journal= {arXiv preprint arXiv:2205.09613},
  year   = {2023}
}

备注

6 figures, 6 tables