中文

BaFTA:面向零样本视觉语言模型的无反向传播测试时自适应

计算机视觉与模式识别 2024-06-19 v2

摘要

像CLIP这样的大规模预训练视觉语言模型在跨不同领域的零样本图像分类中展示了卓越的能力。为了在保持零样本范式的同时提升CLIP的性能,各种测试时提示调优方法被引入,通过在推理过程中利用无监督学习目标来细化类别嵌入。然而,这些方法在测试时自适应期间,由于缺乏验证数据,常常在选择合适的学习率以防止训练崩溃方面遇到挑战。在这项研究中,我们提出了一种新颖的无反向传播算法BaFTA,用于视觉语言模型的测试时自适应。我们的方法不是微调文本提示来细化类别嵌入,而是直接通过在对齐文本和视觉嵌入的投影嵌入空间中进行在线聚类来估计类别质心。我们通过使用Rényi熵评估每个预测的可靠性,动态聚合来自估计和原始类别嵌入以及来自不同增强视图的预测。通过大量实验,我们证明BaFTA在有效性和效率方面始终优于最先进的测试时自适应方法。

关键词

引用

@article{arxiv.2406.11309,
  title  = {BaFTA: Backprop-Free Test-Time Adaptation For Zero-Shot Vision-Language Models},
  author = {Xuefeng Hu and Ke Zhang and Min Sun and Albert Chen and Cheng-Hao Kuo and Ram Nevatia},
  journal= {arXiv preprint arXiv:2406.11309},
  year   = {2024}
}

备注

Preprint updated from our earlier manuscript submitted to ICLR 2024 (https://openreview.net/forum?id=KNtcoAM5Gy)