基于梯度感知分离的视觉语言模型开放集域适应
机器学习
2025-05-21 v1 计算机视觉与模式识别
摘要
开放集域适应 (OSDA) 面临两个挑战:一是跨域对已知类别分布进行对齐,二是识别目标域中特定的未知类别。当前方法往往无法利用模态之间的语义关系,且在未知样本检测方面存在误差累积问题。我们提出利用对比语言-图像预训练 (CLIP) 来应对这些限制,具体包括两个关键创新:1) 基于提示的跨域对齐:学习可在域差异指标条件下动态适应 CLIP 文本编码器的可学习文本提示,实现源域和目标域之间的语义一致性,而无需显式的未知类别监督。2) 梯度感知的开放集分离:梯度分析模块通过比较所学习提示的梯度 L2 范数来量化域迁移,其中已知/未知样本表现出统计上不同的梯度行为。在 Office-Home 数据集上进行的评估表明,我们的方法在持续优于 CLIP 基线和标准基线。消融实验确认梯度范数在其中发挥关键作用。
引用
@article{arxiv.2505.13507,
title = {Open Set Domain Adaptation with Vision-language models via Gradient-aware Separation},
author = {Haoyang Chen},
journal= {arXiv preprint arXiv:2505.13507},
year = {2025}
}