中文

基于CLIP奖励的测试时自适应实现视觉语言模型零样本泛化

计算机视觉与模式识别 2024-02-22 v2 多媒体

摘要

在语言监督下学习的预训练视觉语言模型(VLMs)一个引人入胜的方面是其令人印象深刻的零样本泛化能力。然而,训练与测试数据间的分布偏移阻碍了该能力。先前用于零样本分类的VLM测试时自适应(TTA)方法依赖最小化模型输出的熵,往往陷入不正确的模型预测。本工作中,我们提出带反馈的TTA以纠正模型输出并防止模型变得盲目自信。具体而言,在TTA期间采用CLIP模型作为奖励模型,并为VLM提供反馈。给定单个测试样本,迫使VLM最大化输入与从VLM输出分布中采样结果之间的CLIP奖励。所提出的\textit{带CLIP反馈的强化学习(RLCF)}框架高度灵活且通用。除分类任务外,借助任务特定的采样策略与恰当的奖励基线选择,RLCF可轻松扩展至不仅如检索之类的判别任务,也包括如图像描述之类的生成任务,提升VLM的零样本泛化能力。依据这些视觉语言任务的特性,我们构建了不同的全TTA流水线结合RLCF,以改进各类VLM的零样本泛化能力。大量实验及有前景的经验结果证明了RLCF的有效性。代码见 https://github.com/mzhaoshuai/RLCF。

关键词

引用

@article{arxiv.2305.18010,
  title  = {Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in Vision-Language Models},
  author = {Shuai Zhao and Xiaohan Wang and Linchao Zhu and Yi Yang},
  journal= {arXiv preprint arXiv:2305.18010},
  year   = {2024}
}

备注

accepted by ICLR 2024, project page at https://mzhaoshuai.github.io/RLCF/, code is at https://github.com/mzhaoshuai/RLCF