中文

grounding concreteness:视觉语言模型中类似人类的具体性灵敏度

计算与语言 2026-01-27 v1

摘要

视觉语言模型(VLM)在面对仅含文本提示的评估时,是否发展出比文本-only大型语言模型(LLM)更类似人类的对语言具体性的敏感度?我们通过在多个模型规模上,对比匹配的Llama文本 backbone及其Llama Vision版本来研究这一问题,将多模态预训练视为感知 grounding 而非推断时获取图像的消解。在此基础上,我们在三个互补水平上衡量具体性效应:(i)输出行为,通过将问题级具体性与QA准确率相关联;(ii)嵌入几何,通过测试表示是否沿具体性轴组织;(iii)注意力动态,通过量化上下文依赖性via注意力熵措施。在此基础上,我们还激发模型获取的标记级具体性评级,并评估其与人类规范分布的对齐情况,测试多模态训练是否产生更符合人类常规的评级。在多个基准和规模上,VLM在更具体的输入上表现出更大的提升,展现出更清晰的具体性结构化表示,产生的评级更符合人类规范,以及显示出系统性不同注意力模式,这些模式与增加的grounding相一致。

关键词

引用

@article{arxiv.2601.18065,
  title  = {Grounded Concreteness: Human-Like Concreteness Sensitivity in Vision-Language Models},
  author = {Aryan Roy and Zekun Wang and Christopher J. MacLellan},
  journal= {arXiv preprint arXiv:2601.18065},
  year   = {2026}
}