中文

Nemesis:归一化视觉语言模型中的软提示向量

计算机视觉与模式识别 2024-08-28 v1 人工智能 计算与语言 机器学习

摘要

随着大规模预训练视觉语言模型(如 CLIP)的流行,软提示调谐成为适应这些模型用于各种下游任务的流行方法。然而,很少有研究深入探讨可学习软提示向量的内在属性,特别是它们的范数对视觉语言模型性能的影响。这促使我们提出一个未被探索的研究问题:“我们需要为视觉语言模型中的软提示进行归一化吗?”为填补这一研究空白,我们首先通过进行大规模损坏实验,发现一种称为“低范数效应”的现象,即降低某些学习软提示的范数时偶尔会提高视觉语言模型的性能,而增加范数则常常导致性能下降。为充分利用这一效应,我们提出了一种新方法,称为 Nemesis(Normalizing the soft-prompt vectors of vision-language models),用于归一化视觉语言模型中的软提示向量。据我们所知,我们是首次系统性地研究软提示向量范数在视觉语言模型中的作用,为未来的软提示调谐研究提供了宝贵的见解。代码已公开于 https://github.com/ShyFoo/Nemesis。

关键词

引用

@article{arxiv.2408.13979,
  title  = {Nemesis: Normalizing the Soft-prompt Vectors of Vision-Language Models},
  author = {Shuai Fu and Xiequn Wang and Qiushi Huang and Yu Zhang},
  journal= {arXiv preprint arXiv:2408.13979},
  year   = {2024}
}

备注

Accepted at ICLR 2024 (Spotlight)