中文

大型视觉语言模型与人类在指称交流中的共同基础差异

计算与语言 2026-04-21 v3 人工智能 人机交互

摘要

为了让生成式AI代理能够有效地与人类用户协作,准确预测人类意图至关重要。但这种协作能力受到一个关键缺陷的限制:无法建模共同基础。我们展示了一个具有因子设计的指称交流实验,涉及导演-匹配对(人类-人类、人类-AI、AI-人类和AI-AI),它们在多轮中交互多轮以匹配没有明显词汇化标签的物体图片。我们表明,LVLMs无法以实现流畅交流的方式交互式地生成和解析指称表达式,这是人类语言使用的关键技能。我们发布了包含356段对话(89对,每对4轮)的语料库,以及数据收集的在线流程和分析准确性、效率和词汇重叠的工具。

关键词

引用

@article{arxiv.2601.19792,
  title  = {LVLMs and Humans Ground Differently in Referential Communication},
  author = {Peter Zeng and Weiling Li and Amie Paige and Zhengxiang Wang and Panagiotis Kaliosis and Dimitris Samaras and Gregory Zelinsky and Susan Brennan and Owen Rambow},
  journal= {arXiv preprint arXiv:2601.19792},
  year   = {2026}
}

备注

27 pages, 16 figures