中文

ReCLIP:基于无源域自适应的对比语言-图像预训练精炼方法

计算机视觉与模式识别 2023-12-15 v2 机器学习

摘要

CLIP等大规模视觉-语言预训练模型在零样本分类中表现出色,例如在未见过任何样本的情况下于ImageNet上达到76.3%的top-1准确率,这为许多无标注数据的任务带来了潜在益处。然而,当将CLIP应用于下游目标域时,视觉与文本域差距以及跨模态错位会严重影响模型性能。为应对这些挑战,我们提出ReCLIP,这是首个面向视觉-语言模型的无源域自适应方法,无需任何源数据或目标标注数据。ReCLIP首先学习一个投影空间以缓解错位的视觉-文本嵌入并生成伪标签,随后利用伪标签进行跨模态自训练,更新视觉与文本编码器,迭代地精炼标签并减小域差距与错位。通过大量实验,我们证明ReCLIP在22个图像分类基准上将CLIP的平均错误率从30.17%降至25.06%。代码见 https://github.com/michiganleon/ReCLIP_WACV。

关键词

引用

@article{arxiv.2308.03793,
  title  = {ReCLIP: Refine Contrastive Language Image Pre-Training with Source Free Domain Adaptation},
  author = {Xuefeng Hu and Ke Zhang and Lu Xia and Albert Chen and Jiajia Luo and Yuyin Sun and Ken Wang and Nan Qiao and Xiao Zeng and Min Sun and Cheng-Hao Kuo and Ram Nevatia},
  journal= {arXiv preprint arXiv:2308.03793},
  year   = {2023}
}

备注

Accepted as Oral Paper by 2024 IEEE CVF Winter Conference on Applications of Computer Vision (WACV)