中文

通过对比链式嵌入理解大型视觉语言模型的语言先验

机器学习 2026-02-12 v3 人工智能

摘要

大型视觉语言模型(LVLMs)在多模态任务上取得了强劲性能,但它们往往默认依赖语言先验(LP)——即预训练期间记忆的文本模式,而未能充分利用视觉证据。对 LP 的先前分析大多依赖于输入-输出探测,这无法揭示支配视觉何时以及如何影响模型行为的内部机制。为填补这一空白,我们首次通过链式嵌入(chain-of-embedding)的视角对语言先验进行了系统性分析,该方法考察了 LVLM 内部的逐层表示动态。我们的分析揭示了一个普遍现象:每个模型都表现出视觉整合点(VIP),即视觉信息开始有意义地重塑隐藏表示并影响多模态推理解码的关键层。基于这一观察,我们引入了总视觉整合(TVI)估计量,它聚合了 VIP 之外的表示差异,以量化视觉查询对响应生成的影响程度。在涵盖 10 个当代 LVLM 和 6 个基准的 60 个模型-数据集组合中,我们证明了 VIP 始终出现,且 TVI 可靠地预测了语言先验的强度。这为诊断和理解 LVLM 中的语言先验提供了一个原则性工具包。

关键词

引用

@article{arxiv.2509.23050,
  title  = {Understanding Language Prior of LVLMs by Contrasting Chain-of-Embedding},
  author = {Lin Long and Changdae Oh and Seongheon Park and Sharon Li},
  journal= {arXiv preprint arXiv:2509.23050},
  year   = {2026}
}

备注

ICLR 2026