中文

视觉语言模型令人沮丧的简单测试时自适应方法

计算机视觉与模式识别 2024-11-05 v2 人工智能

摘要

视觉语言模型能够无缝区分任意语义类别,但在面对具有挑战性的样本时仍存在泛化能力不足的问题。为此,近期涌现出基于单张未标注图像的片段式测试时自适应策略。当前测试时自适应研究主要采用边际熵最小化的提示微调范式,该方法依赖在线反向传播,不可避免地会降低推理速度并增加内存消耗。本文从理论上探究了该方法的特性,揭示其中隐藏着一个出奇强大的测试时自适应方法。我们将该方法命名为ZERO(零温度测试时自适应),其设计既极其有效又令人沮丧地简单:对输入进行N次增强、预测、保留最置信的预测结果,并在将Softmax温度设置为零后进行边际化。值得注意的是,ZERO仅需通过视觉编码器进行一次批量前向传播,无需任何反向传播。我们按照文献中建立的实验协议全面评估了该方法,结果表明ZERO大幅超越或与现有最优方法性能相当,同时比标准测试时提示微调快近10倍且内存效率高13倍。凭借其简单性和相对可忽略的计算开销,ZERO可作为该领域未来研究的强基线。代码已开源:https://github.com/FarinaMatteo/zero。

关键词

引用

@article{arxiv.2405.18330,
  title  = {Frustratingly Easy Test-Time Adaptation of Vision-Language Models},
  author = {Matteo Farina and Gianni Franchi and Giovanni Iacca and Massimiliano Mancini and Elisa Ricci},
  journal= {arXiv preprint arXiv:2405.18330},
  year   = {2024}
}

备注

Camera-ready version for NeurIPS 2024