中文

DPA: 双原型对齐用于视觉-语言模型的非监督适应

计算机视觉与模式识别 2024-12-03 v2

摘要

视觉-语言模型(VLM),例如 CLIP,在零样本图像分类中展现了显著潜力。然而,将这些模型适应到新领域仍然具有挑战性,尤其是在没有标注数据的非监督设置中。近期研究提出了基于伪标签的方法,利用无标注的目标数据以非监督方式适应 CLIP。然而,这些方法由于 CLIP 的视觉表示和文本表示之间的错位而产生的噪声伪标签而表现不佳。本研究提出了 DPA,一种用于 VLM 的非监督领域适应方法。DPA 引入了双原型的概念,作为不同的分类器,以及它们输出的凸组合,从而实现精确的伪标签构建。接下来,它对伪标签进行排序以促进鲁棒的自我训练,特别是在训练早期。最后,它通过将文本原型与图像原型对齐来解决视觉-文本错位问题,从而进一步提升适应性能。在 13 个下游视觉任务上的实验表明,DPA 显著优于零样本 CLIP 和最先进的非监督适应基线方法。

关键词

引用

@article{arxiv.2408.08855,
  title  = {DPA: Dual Prototypes Alignment for Unsupervised Adaptation of Vision-Language Models},
  author = {Eman Ali and Sathira Silva and Muhammad Haris Khan},
  journal= {arXiv preprint arXiv:2408.08855},
  year   = {2024}
}

备注

Accepted at WACV 2025