中文

论视觉-语言模型的测试时零样本泛化:我们真的需要提示学习吗?

计算机视觉与模式识别 2024-05-06 v1

摘要

以 CLIP 为代表的大型视觉-语言模型的发展,推动了对有效适配技术的研究,其中软提示微调尤为受到关注。同时,利用单张图像的多个增强视图来提升零样本泛化能力的测试时增强技术,正成为一个重要的研究领域。这主要将研究工作引向了测试时提示调优。相比之下,我们提出了一种鲁棒的测试时增强均值漂移方法(MTA),该方法无需进行这种密集的训练过程即可超越基于提示的方法。这使得 MTA 成为独立应用和基于 API 的应用的理想解决方案。此外,我们的方法不依赖于某些先前测试时增强技术中用于筛选增强视图的特定规则(例如置信度阈值)。相反,MTA 将每个视图的质量评估变量(称为内点得分)直接纳入其优化过程。该得分与密度模式搜索过程联合优化,从而形成了一种高效、无需训练和超参数的方法。我们在 15 个数据集上对我们的方法进行了广泛的基准测试,并证明了 MTA 的优越性和计算效率。MTA 可作为即插即用模块轻松部署在零样本模型和最先进的少样本方法之上,并展现出系统性和一致性的改进。

关键词

引用

@article{arxiv.2405.02266,
  title  = {On the test-time zero-shot generalization of vision-language models: Do we really need prompt learning?},
  author = {Maxime Zanella and Ismail Ben Ayed},
  journal= {arXiv preprint arXiv:2405.02266},
  year   = {2024}
}