中文

面向视觉变化情境下可靠测试时适应的视觉语言模型

计算机视觉与模式识别 2025-08-14 v2

摘要

视觉语言模型 (VLM) 表现出惊人的零样能力,但在无标签数据的情况下难以应对下游任务的分布迁移,这促使开发测试时适应 (TTA) 以在推理期间无需注释提高 VLM 性能。尽管存在各种 TTA 方法,其中基于缓存的方法通过保留低熵样本在动态缓存中的历史知识而前景可期,但这些方法面临两个关键可靠性挑战:(1) 在分布迁移下,熵常常不可靠,导致缓存中误差积累并降低适应性能;(2) 最终预测可能不可靠 due to 灵活性不足的决策边界,无法适应大规模下游迁移。为此,我们提出一种可靠测试时适应 (ReTA) 方法,通过两个互补策略从两个角度增强可靠性。首先,为缓解熵作为缓存构建的样本选择标准的不可靠性,我们引入一致性感知熵重加权 (CER),在缓存更新时 incorporating consistency 约束来对熵进行加权。虽然传统方法仅依赖低熵进行缓存优先级,风险引入噪声,但我们的方法利用预测一致性保持高质量缓存并促进更稳健的适应。其次,我们提出基于多样性的分布校准 (DDC),将类间文本嵌入建模为多变量高斯分布,实现适应性决策边界,以更准确地预测跨视觉异构内容。广泛的实验表明,ReTA 在各种实际分布迁移下均一致优于最先进的方法。代码: https://github.com/Evelyn1ywliang/ReTA。

关键词

引用

@article{arxiv.2507.09500,
  title  = {Advancing Reliable Test-Time Adaptation of Vision-Language Models under Visual Variations},
  author = {Yiwen Liang and Hui Chen and Yizhe Xiong and Zihan Zhou and Mengyao Lyu and Zijia Lin and Shuaicheng Niu and Sicheng Zhao and Jungong Han and Guiguang Ding},
  journal= {arXiv preprint arXiv:2507.09500},
  year   = {2025}
}

备注

Accepted at the 33rd ACM International Conference on Multimedia(ACM MM 2025)