中文

用于通用多源域适应的负文本语义与不确定性建模自适应提示学习

计算机视觉与模式识别 2024-04-25 v2

摘要

通用多源域适应(Universal Multi-source Domain Adaptation, UniMDA)旨在将知识从多个有标签的源域迁移到无标签的目标域,同时应对域偏移(不同数据分布)和类别偏移(未知目标类别)。现有解决方案侧重于挖掘图像特征以检测未知样本,忽略了文本语义中包含的丰富信息。在本文中,我们提出了一种基于对比语言-图像预训练的自适应提示学习与负文本语义及不确定性建模方法(APNE-CLIP),用于 UniMDA 分类任务。具体而言,我们利用带有自适应提示的 CLIP 来利用类别语义和域表示的文本信息,帮助模型识别未知样本并应对域偏移。此外,我们利用负文本语义设计了一种新颖的全局实例级对齐目标,以实现更精确的图像-文本对对齐。进一步地,我们提出了一种基于能量的不确定性建模策略,以扩大已知样本与未知样本之间的边际距离。大量实验证明了我们所提方法的优越性。

关键词

引用

@article{arxiv.2404.14696,
  title  = {Adaptive Prompt Learning with Negative Textual Semantics and Uncertainty Modeling for Universal Multi-Source Domain Adaptation},
  author = {Yuxiang Yang and Lu Wen and Yuanyuan Xu and Jiliu Zhou and Yan Wang},
  journal= {arXiv preprint arXiv:2404.14696},
  year   = {2024}
}

备注

Accepted by ICME2024