中文

视觉-语言模型的上下文内归纳偏置因模态而异

计算机视觉与模式识别 2025-03-17 v2 计算与语言 机器学习

摘要

归纳偏置是学习者在缺乏确凿证据时进行猜测的依据。在认知科学中,这些偏置通常使用概念或类别来研究——例如,通过测试人类如何从几个使类别边界模糊的示例中泛化一个新类别。我们使用这些方法来研究基础模型在上下文学习期间的泛化能力。现代基础模型可以同时处理视觉和文本信息,它们如何解释和学习这些不同模态的差异是一个新兴的研究领域。在此,我们研究它们的泛化如何随刺激呈现的模态以及刺激在文本中的描述方式而变化。我们通过三种不同的实验范式,在三个不同的视觉-语言模型上研究这些偏置。我们发现,模型通常表现出某种偏向于根据形状而非颜色进行泛化的倾向。当示例以视觉方式呈现时,这种形状偏置往往会被放大。相比之下,当示例以文本形式呈现时,形容词的顺序会影响泛化。然而,这些效应的程度因模型和范式而异。这些结果有助于揭示视觉-语言模型如何在上下文中表示不同类型的输入,并可能对视觉-语言模型的使用具有实际意义。

关键词

引用

@article{arxiv.2502.01530,
  title  = {The in-context inductive biases of vision-language models differ across modalities},
  author = {Kelsey Allen and Ishita Dasgupta and Eliza Kosoy and Andrew K. Lampinen},
  journal= {arXiv preprint arXiv:2502.01530},
  year   = {2025}
}

备注

11 pages