中文

Align and Distill:统一与改进领域自适应目标检测

计算机视觉与模式识别 2025-06-25 v4 人工智能 机器学习

摘要

目标检测器在与训练集不同的数据上往往表现不佳。领域自适应目标检测 (DAOD) 方法近期在应对该挑战上展现出优异效果。遗憾的是,我们发现了系统性的基准测试缺陷,这些缺陷使过往结果受到质疑并阻碍了进一步发展:(a) 因基线能力不足导致性能高估;(b) 实现方式不一致,阻碍了方法的透明比较;(c) 因骨干网络过时且基准测试缺乏多样性而导致通用性不足。我们通过引入以下内容解决这些问题:(1) 统一的基准测试与实现框架 Align and Distill (ALDI),支持 DAOD 方法比较并助力未来发展;(2) 针对基准测试缺陷的公平且现代的 DAOD 训练与评估协议;(3) 新的 DAOD 基准数据集 CFC-DAOD,支持在多样化真实数据上进行评估;(4) 新方法 ALDI++,以大幅优势取得 SOTA 结果。ALDI++ 在 Cityscapes 到 Foggy Cityscapes 上较先前 SOTA 提升 +3.5 AP50,在 Sim10k 到 Cityscapes 上提升 +5.7 AP50(我们是唯一超越公平基线的方法),在 CFC Kenai 到 Channel 上提升 +0.6 AP50。ALDI 与 ALDI++ 均与架构无关,无需额外超参数调优即可为基于 YOLO 和 DETR 的 DAOD 创造新 SOTA。我们的框架、数据集与 SOTA 方法为 DAOD 提供了关键重置,并为未来研究奠定坚实基础。代码与数据见:https://github.com/justinkay/aldi 和 https://github.com/visipedia/caltech-fish-counting。

关键词

引用

@article{arxiv.2403.12029,
  title  = {Align and Distill: Unifying and Improving Domain Adaptive Object Detection},
  author = {Justin Kay and Timm Haucke and Suzanne Stathatos and Siqi Deng and Erik Young and Pietro Perona and Sara Beery and Grant Van Horn},
  journal= {arXiv preprint arXiv:2403.12029},
  year   = {2025}
}

备注

TMLR camera ready (Featured Certification). 33 pages, 15 figures