中文

什么构成了视觉语言模型良好的少样本示例?

计算机视觉与模式识别 2024-05-24 v1

摘要

尽管通过少样本微调利用预训练视觉语言(VL)模型在下游任务上取得了显著进展,但我们详细的实证研究强调了少样本学习结果对训练示例精心选择的显著依赖性——这一方面在以往的研究中被忽视。在本研究中,我们深入探讨了设计更有效的策略来精心选择少样本训练示例,而不是依赖随机采样,以增强现有少样本提示学习方法的潜力。为此,我们评估了各种主动学习(AL)技术在少样本训练背景下进行实例选择的有效性,例如熵和置信度边际。此外,我们引入了两种创新的选择方法——代表性(REPRE)和高斯蒙特卡洛(Montecarlo)——旨在主动为预训练VL模型定位信息丰富的示例进行标注。我们的发现表明,在少样本训练场景中,REPRE和Montecarlo都显著优于随机选择和基于AL的策略。研究还强调,这些实例选择方法是模型无关的,为各种少样本训练方法提供了通用的增强。

关键词

引用

@article{arxiv.2405.13532,
  title  = {What Makes Good Few-shot Examples for Vision-Language Models?},
  author = {Zhaojun Guo and Jinghui Lu and Xuejing Liu and Rui Zhao and ZhenXing Qian and Fei Tan},
  journal= {arXiv preprint arXiv:2405.13532},
  year   = {2024}
}

备注

8 pages, 4 figures