通过自训练对齐评分实现对 CLIP 的精细适应
计算机视觉与模式识别
2025-07-15 v1
摘要
视觉语言模型(VLM)如 CLIP 通过对比预训练对齐图像和文本表示,在零样态学习中表现突出。现有的无监督适应方法要么依赖固定的对齐评分,无法捕捉演化中细微的类别差异;要么采用计算昂贵的伪标签策略,限制了可扩展性。相反,我们展示在适应期建模细粒度跨模态交互可生成更准确、具类别判别性的伪标签,从而显著提升性能。我们提出 Fine-grained Alignment and Interaction Refinement(FAIR),一种创新的方法,通过一组类别描述锚点(CDA)动态对齐局部图像特征与描述性语言嵌入,实现对细粒度交互的建模。这使得定义一种学习型对齐评分(LAS)成为可能,其中 CDA 作为自适应分类器,促进跨模态交互以提高无监督适应中的自训练效果。此外,我们提出一种自训练加权机制,用于在类别间模糊性存在时细化伪标签。我们的 FAIR 方法在细粒度无监督适应任务中实现了显著的性能提升,较 SOTA 方法整体提升 2.78%。
引用
@article{arxiv.2507.09615,
title = {Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score},
author = {Eman Ali and Sathira Silva and Chetan Arora and Muhammad Haris Khan},
journal= {arXiv preprint arXiv:2507.09615},
year = {2025}
}