GS-Bias: 用于Vision-Language模型单图像测试时适应的全局-空间偏置学习器
计算机视觉与模式识别
2025-07-17 v1
摘要
近期在Vision-Language Models(VLMs)的测试时适应(TTA)方面取得了进展,尤其是通过使用单个图像的多个增强视图来提升零样例泛化。然而,现有方法未能在性能和效率之间取得令人满意的平衡,原因在于文本提示的开销过大或来自手工制作、训练自由的视觉特征增强带来的不稳定收益。在本文中,我们提出了Global-Spatial Bias Learner(GS-Bias),这是一种高效且有效的TTA范式,包含两个可学习的偏置:全局偏置和空间偏置。特别是,全局偏置通过学习增强视图之间的一致性来捕获测试图像的全局语义特征,而空间偏置学习图像空间视觉表示中区域之间的语义一致性。值得注意的是,这两组偏置直接添加到预训练VLMs的logits输出中,这规避了对VLMs进行完整反向传播的需求,从而限制了现有TTA方法的效率。这使GS-Bias在保持极高效率的同时,在15个基准数据集上实现了最先进的性能。例如,在跨数据集泛化和域泛化方面,分别比TPT提高了2.23%和2.72%,而仅使用TPT内存的6.5%。
引用
@article{arxiv.2507.11969,
title = {GS-Bias: Global-Spatial Bias Learner for Single-Image Test-Time Adaptation of Vision-Language Models},
author = {Zhaohong Huang and Yuxin Zhang and Jingjing Xie and Fei Chao and Rongrong Ji},
journal= {arXiv preprint arXiv:2507.11969},
year = {2025}
}