视觉-语言模型错失的机会:在线测试时适应的比较研究
计算机视觉与模式识别
2024-09-10 v2
摘要
在深度学习中,保持模型对分布偏移的鲁棒性至关重要。这项工作探索了在测试时适应视觉-语言基础模型的广泛可能性,特别关注CLIP及其变体。该研究系统地研究了基于提示的技术和现有的测试时适应方法,旨在提高在多样化真实场景中分布偏移下的鲁棒性。具体来说,调查涵盖了各种提示工程策略,包括手工提示、提示集成和提示学习技术。此外,我们引入了一种视觉-文本空间集成,与仅文本空间集成相比,显著提高了平均性能。由于在线测试时适应已被证明可以有效缓解分布偏移下的性能下降,该研究将其范围扩展到评估现有测试时适应方法的有效性,这些方法最初是为纯视觉分类模型设计的。通过在多个数据集和不同模型架构上进行广泛的实验评估,该研究证明了这些适应策略的有效性。代码可在https://github.com/mariodoebler/test-time-adaptation获取。
引用
@article{arxiv.2405.14977,
title = {A Lost Opportunity for Vision-Language Models: A Comparative Study of Online Test-Time Adaptation for Vision-Language Models},
author = {Mario Döbler and Robert A. Marsden and Tobias Raichle and Bin Yang},
journal= {arXiv preprint arXiv:2405.14977},
year = {2024}
}
备注
Accepted at ECCV 2024 OOD-CV Workshop