视觉-语言模型的贝叶斯测试时自适应
计算机视觉与模式识别
2025-03-18 v2
摘要
使用预训练视觉-语言模型(如 CLIP)进行测试时自适应,旨在使模型适应新的、潜在的分布外测试数据。现有方法通过计算视觉嵌入与可学习类嵌入(由文本嵌入初始化)之间的相似度,来实现零样本图像分类。在本工作中,我们首先基于贝叶斯定理分析了这一过程,并观察到影响最终预测的核心因素是似然和先验。然而,现有方法本质上专注于自适应类嵌入以调整似然,却往往忽略了先验的重要性。为了弥补这一差距,我们提出了一种新方法,即\textbf{贝}叶斯\textbf{类}自\textbf{适}应(Bayesian Class Adaptation, BCA),除了持续更新类嵌入以自适应似然外,还利用输入样本的后验来持续更新每个类嵌入的先验。这种双重更新机制使模型能够更好地适应分布偏移并实现更高的预测准确率。我们的方法不仅在性能指标上超越了现有方法,而且保持了更优的推理速度和内存占用,使其在现实应用中非常高效且实用。
引用
@article{arxiv.2503.09248,
title = {Bayesian Test-Time Adaptation for Vision-Language Models},
author = {Lihua Zhou and Mao Ye and Shuaifeng Li and Nianxin Li and Xiatian Zhu and Lei Deng and Hongbin Liu and Zhen Lei},
journal= {arXiv preprint arXiv:2503.09248},
year = {2025}
}
备注
Accepted to CVPR 2025