UPRE:面向零样本目标检测域适应的统一提示与表示增强
计算机视觉与模式识别
2025-07-22 v2
摘要
零样本域适应(ZSDA)因目标域缺乏图像而面临重大挑战。以往方法利用视觉语言模型(Vision-Language Models, VLMs)来应对这一挑战,利用其零样本学习能力。然而,这些方法主要解决域分布迁移问题,忽略了检测任务与 VLMs 之间的对齐问题,而 VLMs 依赖人工设计的提示。为克服这些限制,我们提出了统一提示与表示增强(UPRE)框架,联合优化文本提示和视觉表示。具体而言,我们的方法引入了多视图域提示,结合语言域先验与检测特定知识,并提出了视觉表示增强模块以产生域风格变体。进一步,我们引入多级增强策略,包括相对域距离和正负分离,分别在图像层面对齐多模态表示,在实例层面捕获多样化的视觉表示。在九个基准数据集上的大量实验表明,我们框架在 ZSDA 检测场景中表现优异。代码已公开于 https://github.com/AMAP-ML/UPRE。
引用
@article{arxiv.2507.00721,
title = {UPRE: Zero-Shot Domain Adaptation for Object Detection via Unified Prompt and Representation Enhancement},
author = {Xiao Zhang and Fei Wei and Yong Wang and Wenda Zhao and Feiyi Li and Xiangxiang Chu},
journal= {arXiv preprint arXiv:2507.00721},
year = {2025}
}
备注
ICCV2025