突破边界: 利用视觉基础模型进行源自由目标检测
计算机视觉与模式识别
2026-01-22 v2 人工智能
摘要
源自由目标检测 (SFOD) 旨在无需访问源数据的情况下,将源预训练目标检测器适配到目标域。然而,现有 SFOD 方法主要依赖源模型内部的知识,这限制了其在跨域泛化能力,常导致偏差化的伪标签,从而阻碍了可迁移性和判别性。相比之下,视觉基础模型 (VFM) 预训练于大规模且多样化的数据,具有强大的感知能力和广泛的泛化潜力,但在 SFOD 场景中仍被大量未被利用。本文提出一种新颖的 SFOD 框架,将 VFM 作为外部知识源,以增强特征对齐和标签质量。具体而言,我们设计了三个 VFM 基于模块:(1) 基于 patch 相似度加权的全局特征对齐 (PGFA),从 VFM 中提取全局特征以增强全局特征的可迁移性;(2) 基于原型的实例特征对齐 (PIFA),利用动力学更新的 VFM 原型进行实例级对比学习;(3) 双源增强伪标签融合 (DEPF),通过熵感知策略融合检测 VFM 和教师模型的预测,以获得更可靠的监督。广泛的实验在六个基准数据集上表明,我们的方法实现了 SFOD 的最新性能,验证了将 VFM 集成以同时提升可迁移性和判别性的有效性。
引用
@article{arxiv.2511.07301,
title = {Beyond Boundaries: Leveraging Vision Foundation Models for Source-Free Object Detection},
author = {Huizai Yao and Sicheng Zhao and Pengteng Li and Yi Cui and Shuo Lu and Weiyu Guo and Yunfan Lu and Yijie Xu and Hui Xiong},
journal= {arXiv preprint arXiv:2511.07301},
year = {2026}
}
备注
Accepted to AAAI 2026. Extended version with full Appendix