视觉语言模型中基于公平上下文学习的证据平衡测试时适应
计算机视觉与模式识别
2026-02-10 v1 机器学习
摘要
视觉语言模型(VLMs)如CLIP能够实现强大的零样本识别,但在分布迁移下性能会显著下降。测试时适应(TTA)旨在仅使用无标签测试样本提升鲁棒性,但大多数基于提示的TTA方法依赖于熵最小化——这种方法在类别共享视觉特征时会放大虚假关联,导致过度自信的错误。我们提出公平上下文学习(FCL),一种基于episodic的TTA框架,避免熵最小化,通过显式解决共享证据偏见来实现。受我们加法证据分解假设的启发,FCL将适应分解为(i)基于数据增强的探索以识别可行的类别候选集合,以及(ii)基于公平性的校准,该校准调整文本上下文以消化对常见视觉证据的敏感性。这种公平性约束缓解了部分特征专注的问题,使我们能够在不依赖熵减少的情况下有效校准文本嵌入。通过广泛的评估,我们经验上验证了我们的理论动机,显示FCL在多样化的域迁移和细粒度基准测试中,相对于最先进的TTA方法实现了竞争的适应性能。
引用
@article{arxiv.2602.07027,
title = {Fair Context Learning for Evidence-Balanced Test-Time Adaptation in Vision-Language Models},
author = {Sanggeon Yun and Ryozo Masukawa and SungHeon Jeong and Wenjun Huang and Hanning Chen and Mohsen Imani},
journal= {arXiv preprint arXiv:2602.07027},
year = {2026}
}