中文

BATCLIP:用于CLIP的双模态在线测试时自适应

计算机视觉与模式识别 2025-08-04 v3

摘要

尽管像对比语言-图像预训练(CLIP)这样的开放词汇分类模型已展现出强大的零样本学习能力,但其对常见图像损坏的鲁棒性仍知之甚少。通过大量实验,我们发现零样本CLIP在测试时对常见图像损坏缺乏鲁棒性,因此需要使用测试时自适应(TTA)方法使CLIP适应未标记的损坏图像。然而,我们发现现有的TTA方法由于单模态特性,在适应CLIP方面存在严重局限性。为解决这些问题,我们提出了BATCLIP,一种双模态在线TTA方法,旨在提高CLIP对常见图像损坏的鲁棒性。我们方法的关键见解不仅在于调整视觉编码器以改进图像特征,还在于通过促进图像类别原型(使用伪标签计算)与相应文本特征之间的对齐,来加强图像和文本特征之间的关联。我们在基准图像损坏数据集上评估了我们的方法,并在CLIP的在线TTA中取得了最先进的结果。此外,我们还在各种领域泛化数据集上评估了我们提出的TTA方法,以展示其泛化能力。我们的代码可在https://github.com/sarthaksharma/BATCLIP获取。

引用

@article{arxiv.2412.02837,
  title  = {$\texttt{BATCLIP}$: Bimodal Online Test-Time Adaptation for CLIP},
  author = {Sarthak Kumar Maharana and Baoming Zhang and Leonid Karlinsky and Rogerio Feris and Yunhui Guo},
  journal= {arXiv preprint arXiv:2412.02837},
  year   = {2025}
}

备注

ICCV 2025