中文

当话语压力冲突时:视觉-语言模型输出中的信息结构

计算与语言 2026-05-28 v1

摘要

视觉-语言模型(VLMs)日益被评估其是否识别正确的视觉内容,但关于它们是否以话语恰当形式表达这些内容的了解仍很少。我们利用信息结构(IS),测试 VLMs 是否区分话语旧主题(discourse-old Topics)和话语新焦点(discourse-new Foci)在视觉 grounding 提问中的表述。我们利用匈牙利语,这是一种话语主题和焦点映射到专用句法位置的语言,使 IS 选择在文本中可观察。比较六个 VLMs 与人类参与者,我们发现模型会产生与 IS 相关的构件,但过度正则化这种敏感性。在话语状态、句法角色(偏好主语主题)和指称性(偏好不确定焦点)的相互作用压力下,人类选择可变的策略来实现 IS 实施。相比之下,VLMs 崩溃到狭窄的响应模板,类似于模式崩溃(Kirk 等,2024)。我们的发现表明,VLM 评估应关注内容准确性之外的内容如何被包装以供话语使用。

关键词

引用

@article{arxiv.2605.28346,
  title  = {When Discourse Pressures Conflict: Information Structure in Vision-Language Model Outputs},
  author = {Marcell Fekete and Johannes Bjerva and Tamás Káldi},
  journal= {arXiv preprint arXiv:2605.28346},
  year   = {2026}
}