面向无监督域适应的提示学习中的簇类保持
计算机视觉与模式识别
2025-06-16 v1
摘要
最近利用如CLIP等多模态预训练模型的无监督域适应(UDA)方法在跨域格局和改进泛化性方面取得了显著进展,凭借通过在多样化图像-文本数据集上进行预训练所获得的丰富语义知识和稳健视觉表示。尽管这些方法在基准测试上实现了最先进的性能,但大量提升归功于基准伪标签(CLIP零样子预测)和自训练机制。因此,训练机制存在关键局限,即目标域中的视觉嵌入分布可偏离预训练模型中的视觉嵌入分布,导致来自类别描述的信号偏导。本文提出了一种新方法,通过利用视觉和文本嵌入之间的几何关系来强化这些伪标签并促进目标提示学习——这是现有方法所忽视的方面。我们首先提出直接利用基于源提示与目标视觉嵌入关系的参考预测。随后我们发现,预训练多模态模型中视觉嵌入与文本嵌入之间存在强烈的聚类行为。基于最优输运理论,我们将这一洞见转化为一种新策略,以强制执行文本嵌入中的聚类属性,从而进一步增强目标域中的对齐。在实验和消融研究中验证了所提方法的有效性,显示其在性能和表示方面均显著优于现有方法。
引用
@article{arxiv.2506.11493,
title = {Preserving Clusters in Prompt Learning for Unsupervised Domain Adaptation},
author = {Tung-Long Vuong and Hoang Phan and Vy Vo and Anh Bui and Thanh-Toan Do and Trung Le and Dinh Phung},
journal= {arXiv preprint arXiv:2506.11493},
year = {2025}
}