中文

视觉语言模型的高效测试时自适应

计算机视觉与模式识别 2024-03-28 v1

摘要

利用预训练视觉语言模型进行测试时自适应以应对测试期间的分布偏移,引起了越来越多的关注。尽管先前的研究取得了非常有前景的性能,但它们涉及密集的计算,这与测试时自适应严重不符。我们设计了 TDA,一种免训练的动态适配器,能够利用视觉语言模型实现有效且高效的测试时自适应。TDA 使用轻量级的键值缓存,该缓存维护一个动态队列,以少样本伪标签作为值,以相应的测试样本特征作为键。利用键值缓存,TDA 通过渐进式伪标签细化逐渐适应测试数据,该过程极其高效且不会产生任何反向传播。此外,我们引入了负伪标签,当模型对其伪标签预测不确定时,通过将伪标签分配给某些负类,减轻伪标签噪声的不利影响。在两个基准上的大量实验表明,与现有最优方法相比,TDA 具有卓越的有效性和效率。代码已发布在 \url{https://kdiaaa.github.io/tda/}。

关键词

引用

@article{arxiv.2403.18293,
  title  = {Efficient Test-Time Adaptation of Vision-Language Models},
  author = {Adilbek Karmanov and Dayan Guan and Shijian Lu and Abdulmotaleb El Saddik and Eric Xing},
  journal= {arXiv preprint arXiv:2403.18293},
  year   = {2024}
}

备注

Accepted to CVPR 2024. The code has been released in \url{https://kdiaaa.github.io/tda/}