面向视觉-语言模型测试时自适应的子空间对齐
计算机视觉与模式识别
2026-01-14 v1 人工智能
摘要
视觉-语言模型(VLM)尽管具有非凡的零样本能力,但容易受到分布偏移的影响。测试时自适应(TTA)成为一种在运行时将 VLM 适应于未标记测试数据的主要策略。然而,现有的 TTA 方法严重依赖零样本预测作为自训练的伪标签,这在分布偏移下可能不可靠,并因两个基本限制而误导自适应。首先(模态差距),分布偏移导致视觉和文本模态之间的差距,使得跨模态关系不准确。其次(视觉噪声),视觉嵌入编码了丰富但与任务无关的噪声,在分布偏移下常常淹没任务特定的语义。为了解决这些限制,我们提出了 SubTTA,它对齐两种模态的语义子空间以增强零样本预测,从而更好地指导 TTA 过程。为了弥合模态差距,SubTTA 提取两种模态的主子空间,并通过最小化它们的弦距离将视觉流形对齐到文本语义锚点。为了消除视觉噪声,SubTTA 将对齐后的视觉特征投影到任务特定的文本子空间,通过将视觉嵌入约束在有效的语义跨度内来滤除与任务无关的噪声,并在净化后的空间上进一步执行标准 TTA 以细化决策边界。在各种基准测试和 VLM 架构上的大量实验证明了 SubTTA 的有效性,与最先进的 TTA 方法相比,平均提高了 2.24%。
引用
@article{arxiv.2601.08139,
title = {Subspace Alignment for Vision-Language Model Test-time Adaptation},
author = {Zhichen Zeng and Wenxuan Bao and Xiao Lin and Ruizhong Qiu and Tianxin Wei and Xuying Ning and Yuchen Yan and Chen Luo and Monica Xiao Cheng and Jingrui He and Hanghang Tong},
journal= {arXiv preprint arXiv:2601.08139},
year = {2026}
}
备注
17 pages, 10 figures