中文

MTTrans:基于均值教师 Transformer 的跨域目标检测

计算机视觉与模式识别 2022-08-17 v2

摘要

近来,端到端目标检测流程 DEtection TRansformer (DETR) 取得了令人瞩目的性能。然而,它需要大规模标注数据,并且受域偏移影响,尤其在目标域无标注数据可用时。为解决该问题,我们提出一种基于均值教师框架的端到端跨域检测 Transformer——MTTrans,它能在目标检测训练中充分利用无标注目标域数据,并通过伪标签在域间迁移知识。我们进一步提出综合多级特征对齐,利用 Deformable DETR 中的跨尺度自注意力机制,改进均值教师框架生成的伪标签。借助基于域查询的特征对齐(DQFA)、双层基于图的原型对齐(BGPA)和逐 token 图像特征对齐(TIFA),在局部、全局和实例层面对图像与物体特征进行对齐。另一方面,经均值教师框架伪标注且可用于目标检测训练的无标注目标域数据,可带来更好的特征提取与对齐。因此,均值教师框架与综合多级特征对齐可基于 Transformer 架构迭代且相互优化。大量实验表明,我们所提方法在三种域适应场景中均达到最先进性能,其中 Sim10k 到 Cityscapes 场景的结果从 52.6 mAP 显著提升至 57.9 mAP。代码将公开。

关键词

引用

@article{arxiv.2205.01643,
  title  = {MTTrans: Cross-Domain Object Detection with Mean-Teacher Transformer},
  author = {Jinze Yu and Jiaming Liu and Xiaobao Wei and Haoyi Zhou and Yohei Nakata and Denis Gudovskiy and Tomoyuki Okuno and Jianxin Li and Kurt Keutzer and Shanghang Zhang},
  journal= {arXiv preprint arXiv:2205.01643},
  year   = {2022}
}

备注

Accepted by ECCV 2022