中文

基于掩码特征对齐的平均教师 DETR:一种鲁棒的域自适应检测 Transformer 框架

计算机视觉与模式识别 2024-01-19 v5

摘要

基于 Detection Transformer (DETR) 的无监督域自适应目标检测 (UDAOD) 研究主要集中于特征对齐,现有方法可分为两类,每类均有尚未解决的问题。单阶段特征对齐方法易导致性能波动与训练停滞。基于平均教师的两阶段特征对齐方法包含一个预训练阶段和一个自训练阶段,二者分别在获得可靠预训练模型与取得一致性能提升方面面临问题。上述方法尚未探索如何利用第三相关域(如类目标域)来辅助自适应。为解决这些问题,我们提出一种名为 MTM 的两阶段框架,即基于掩码特征对齐的平均教师 DETR (Mean Teacher-DETR with Masked Feature Alignment)。在预训练阶段,我们利用图像风格迁移生成的带标签类目标图像以避免性能波动。在自训练阶段,我们基于平均教师利用无标签目标图像生成伪标签,并提出一种称为目标查询知识迁移 (Object Queries Knowledge Transfer, OQKT) 的模块以确保学生模型的一致性能提升。最重要的是,我们提出包括基于掩码域查询的特征对齐 (Masked Domain Query-based Feature Alignment, MDQFA) 与掩码逐 token 特征对齐 (Masked Token-wise Feature Alignment, MTWFA) 在内的掩码特征对齐方法,以更鲁棒的方式缓解域偏移,其不仅在预训练阶段防止训练停滞并得出鲁棒的预训练模型,也在自训练阶段提升模型的目标性能。在三个具有挑战性场景上的实验与一项理论分析验证了 MTM 的有效性。

关键词

引用

@article{arxiv.2310.15646,
  title  = {Mean Teacher DETR with Masked Feature Alignment: A Robust Domain Adaptive Detection Transformer Framework},
  author = {Weixi Weng and Chun Yuan},
  journal= {arXiv preprint arXiv:2310.15646},
  year   = {2024}
}

备注

AAAI2024