大型自监督模型在域自适应目标检测中的桥接作用
计算机视觉与模式识别
2025-04-01 v1
摘要
当前域自适应目标检测(DAOD)的前沿方法采用均值教师自标注方式,其中教师模型直接作为学生模型的指数移动平均,用于生成目标域上的标签,然后用于改进两个模型形成正向循环。这种耦合方式脆弱且受限:学生仅在源数据上训练是否能生成准确的目标域标签以启动正向循环,以及使用更大预训练网络生成的标签是否更优。视觉基础模型正是这种模型,展示出即使冻结也具备强大的任务泛化能力。我们利用这些模型进行 DAOD,引入 DINO Teacher,其包含两个组件:首先,我们仅使用冻结的 DINOv2 主干网络在源数据上训练新的标注器,证明其生成的标签比均值教师更准确。其次,我们将学生的源域和目标域图像块特征与来自 DINO 编码器的特征对齐,使源域和目标域表征更接近通用可泛化的 DINO 表征。我们在多个 DAOD 数据集上取得了最先进的性能。代码可在 https://github.com/TRAILab/DINO_Teacher 查阅。
引用
@article{arxiv.2503.23220,
title = {Large Self-Supervised Models Bridge the Gap in Domain Adaptive Object Detection},
author = {Marc-Antoine Lavoie and Anas Mahmoud and Steven L. Waslander},
journal= {arXiv preprint arXiv:2503.23220},
year = {2025}
}
备注
16 pages (8 main), 5 figures, accepted at CVPR 2025