统一模态分离:面向无监督域适应的视觉语言框架
计算机视觉与模式识别
2025-08-08 v1
摘要
无监督域适应(UDA)使在标记的源域上训练的模型能够处理新的无标记域。最近的预训练视觉语言模型(VLMs)通过利用语义信息在零样本任务中展示了有前景的性能。通过对齐视觉和文本嵌入,VLMs 在桥接域差异方面已取得显著成功。然而,模态之间本质上存在差异,这被称为模态差距。我们的发现表明,仅在模态差距的存在下进行直接UDA只会传递模态不变的知识,导致目标性能不佳。为此,我们提出了一种统一模态分离框架,容纳模态特定和模态不变组件。训练期间,不同模态组件从VLM特征中解耦,然后以统一方式处理。在测试期间,自动确定模态自适应集成权重以最大化不同组件的协同作用。为评估实例级模态特征,我们设计了模态差异度度量,将样本分类为模态不变、模态特定和不确定。利用模态不变样本进行跨模态对齐,而不确定样本则用于增强模型能力。基于提示调谋技术,我们的方法在各种 backbone、基线、数据集和适应设置下实现了显著的性能提升。
引用
@article{arxiv.2508.04987,
title = {Unified modality separation: A vision-language framework for unsupervised domain adaptation},
author = {Xinyao Li and Jingjing Li and Zhekai Du and Lei Zhu and Heng Tao Shen},
journal= {arXiv preprint arXiv:2508.04987},
year = {2025}
}
备注
Accepted to TPAMI