视觉语言模型的真实测试时适应
计算机视觉与模式识别
2025-01-08 v1
摘要
视觉语言模型(VLMs)的零样本能力被广泛利用以提高预测性能。然而,以往关于转换或测试时适应(TTA)的工作通常对数据分布提出强假设,例如存在所有类别。我们的工作挑战了这些有利的部署场景,引入更真实的评估框架,包括:(i)单个 batch 中有效类别数的可变性,以及(ii)在在线适应设置中非独立同分布(non-i.i.d.)的测试样本 batch。我们提供了全面的评估、比较和消融研究,证明当前的转换或TTA方法在各种真实场景下系统性地损害模型初始的零样本鲁棒性,偏向在有利于测试样本分布假设下获得性能提升。此外,我们提出了StatA方法,可处理各种部署场景,包括在测试时有效类别数可变的情况。我们的方案包含一种为VLMs专门设计的正则化项,作为统计锚点,保持初始文本编码器的知识,特别是在低数据 regime中。代码已公开于 https://github.com/MaxZanella/StatA。
引用
@article{arxiv.2501.03729,
title = {Realistic Test-Time Adaptation of Vision-Language Models},
author = {Maxime Zanella and Clément Fuchs and Christophe De Vleeschouwer and Ismail Ben Ayed},
journal= {arXiv preprint arXiv:2501.03729},
year = {2025}
}