基于CLIP奖励的测试时自适应实现视觉语言模型零样本泛化
计算机视觉与模式识别
2024-02-22 v2 多媒体
摘要
在语言监督下学习的预训练视觉语言模型(VLMs)一个引人入胜的方面是其令人印象深刻的零样本泛化能力。然而,训练与测试数据间的分布偏移阻碍了该能力。先前用于零样本分类的VLM测试时自适应(TTA)方法依赖最小化模型输出的熵,往往陷入不正确的模型预测。本工作中,我们提出带反馈的TTA以纠正模型输出并防止模型变得盲目自信。具体而言,在TTA期间采用CLIP模型作为奖励模型,并为VLM提供反馈。给定单个测试样本,迫使VLM最大化输入与从VLM输出分布中采样结果之间的CLIP奖励。所提出的\textit{带CLIP反馈的强化学习(RLCF)}框架高度灵活且通用。除分类任务外,借助任务特定的采样策略与恰当的奖励基线选择,RLCF可轻松扩展至不仅如检索之类的判别任务,也包括如图像描述之类的生成任务,提升VLM的零样本泛化能力。依据这些视觉语言任务的特性,我们构建了不同的全TTA流水线结合RLCF,以改进各类VLM的零样本泛化能力。大量实验及有前景的经验结果证明了RLCF的有效性。代码见 https://github.com/mzhaoshuai/RLCF。
引用
@article{arxiv.2305.18010,
title = {Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in Vision-Language Models},
author = {Shuai Zhao and Xiaohan Wang and Linchao Zhu and Yi Yang},
journal= {arXiv preprint arXiv:2305.18010},
year = {2024}
}
备注
accepted by ICLR 2024, project page at https://mzhaoshuai.github.io/RLCF/, code is at https://github.com/mzhaoshuai/RLCF