中文

进度幻象?对视觉语言模型测试时适应的批判性检视

机器学习 2025-10-14 v2 计算机视觉与模式识别

摘要

测试时适应(TTA)方法因在推理期间无需额外标注数据即可提升视觉语言模型(VLMs)如 CLIP 的性能而受到广泛关注。然而,当前 TTA 研究普遍存在主要局限性,如基线结果重复、评估指标有限、实验设置不一致以及分析不足。这些问题阻碍了 TTA 方法之间的公平比较,并难以评估其实际优势与不足。为应对这些挑战,我们引入 TTA-VLM,作为评估 VLMs 上 TTA 方法的全面基准。我们的基准在统一且可复现的框架下实现了 8 种情景 TTA 与 7 种在线 TTA 方法,并跨越 15 个广泛使用的数据集进行评估。不同于仅关注 CLIP 的先前研究,我们将评估范围扩展至采用 Sigmoid loss 训练的 SigLIP,并纳入诸如 CoOp、MaPLe 与 TeCoA 等训练时调优方法以评估通用性。除分类准确率外,TTA-VLM 还包含鲁棒性、校准、越域检测与稳定性等多种评估指标,实现对 TTA 方法更全面的评估。通过大规模实验,我们发现:1)现有 TTA 方法相较于先前的开创性工作仅带来有限提升;2)当前 TTA 方法与训练时微调方法表现不佳;3)准确率提升常常以牺牲模型可信度为代价。我们发布 TTA-VLM 以提供公平比较与全面评估 VLMs 的 TTA 方法,并希望鼓励社区发展更可靠与更通用的 TTA 策略。

关键词

引用

@article{arxiv.2506.24000,
  title  = {The Illusion of Progress? A Critical Look at Test-Time Adaptation for Vision-Language Models},
  author = {Lijun Sheng and Jian Liang and Ran He and Zilei Wang and Tieniu Tan},
  journal= {arXiv preprint arXiv:2506.24000},
  year   = {2025}
}

备注

NeurIPS 2025 Datasets and Benchmarks Track. Github link: https://github.com/TomSheng21/tta-vlm