VFM$^{4}$SDG:揭示 VFMs 在单域广义目标检测中的强大能力
计算机视觉与模式识别
2026-05-25 v2
摘要
现实世界的天气、光照和成像变化常常导致严重的域迁移,使单源检测器在未见环境中的表现下降。现有的单域广义目标检测(SDGOD)方法主要依赖数据增强或域无关学习,而忽略了域迁移如何破坏检测器预测稳定性。通过分析实验,我们发现性能下降主要由增加的漏检率所主导。进一步分析表明,这一现象源于 DETR 类检测器在跨域稳定性降低:域迁移破坏了编码器侧的对象-背景及实例间关系,并削弱了解码器查询与真实物体之间的语义-空间绑定。鼓励这一发现,我们意识到视觉基础模型(VFMs)在严重偏移下仍保持稳定的关系结构和对象响应,因而适合作为跨域稳定性先验来补偿检测器的性能衰减。为此,我们提出 VFMSDG,一个用于 SDGOD 的双先验学习框架,将冻结的 VFMs 引入编码器表征学习和解码器查询建模。具体而言,我们提出跨域稳定关系先验蒸馏,将 VFMs 中的稳定对象-背景及实例间关系蒸馏到编码器,以补偿关系退化。同时,我们提出基于语义-上下文先验的查询增强,将类别语义原型和全局对象上下文注入查询中,以增强查询-对象绑定的稳定性。广泛的实验表明,VFMSDG 在标准 SDGOD 基准数据集和两种主流 DETR 类检测框架上均显著优于现有先进方法,展现出其有效性、鲁棒性和普适性。
引用
@article{arxiv.2604.21502,
title = {VFM$^{4}$SDG: Unveiling the Power of VFMs for Single-Domain Generalized Object Detection},
author = {Yupeng Zhang and Ruize Han and Ningnan Guo and Wei Feng and Song Wang and Liang Wan},
journal= {arXiv preprint arXiv:2604.21502},
year = {2026}
}