中文

面向视觉语言模型的在线高斯测试时适应

计算机视觉与模式识别 2025-01-09 v1

摘要

视觉语言模型 (Vision-Language Models, VLMs) 的在线测试时适应 (Online Test-Time Adaptation, OTTA) 近期因能够利用沿数据流观察到的信息以提升未来预测而受到关注。然而,现有方法依赖于数据集特定的超参数,显著限制了对未见任务的适应性。为此,我们提出了在线高斯适应 (Online Gaussian Adaptation, OGA) 方法,建模视觉特征的似然分布,并将零样子先验纳入可解释的Maximum A Posteriori (MAP) 估计框架,实现跨数据集固定超参数。我们证明 OGA 在大多数数据集上超越最新方法,且运行效率更佳。此外,我们表明将 OTTA 与流行的 few-shot 技术结合(先前研究中被忽视的实际场景) highly beneficial。进一步,我们的实验显示,常用的 OTTA 评估协议(最多运行三个数据集)因所有 OTTA 方法在不同运行间的显著波动而不足。因此,我们主张更严格的评估实践,包括增加运行次数并考虑额外定量指标,如本文提出的期望尾部准确率 (Expected Tail Accuracy, ETA),计算为最差 10% 运行的平均准确率。我们希望这些贡献能鼓励 OTTA 社区采取更严谨、更具多样性的评估实践。代码已公开于 https://github.com/cfuchs2023/OGA。

关键词

引用

@article{arxiv.2501.04352,
  title  = {Online Gaussian Test-Time Adaptation of Vision-Language Models},
  author = {Clément Fuchs and Maxime Zanella and Christophe De Vleeschouwer},
  journal= {arXiv preprint arXiv:2501.04352},
  year   = {2025}
}