大型视觉语言模型与人类在指称交流中的共同基础差异
计算与语言
2026-04-21 v3 人工智能
人机交互
摘要
为了让生成式AI代理能够有效地与人类用户协作,准确预测人类意图至关重要。但这种协作能力受到一个关键缺陷的限制:无法建模共同基础。我们展示了一个具有因子设计的指称交流实验,涉及导演-匹配对(人类-人类、人类-AI、AI-人类和AI-AI),它们在多轮中交互多轮以匹配没有明显词汇化标签的物体图片。我们表明,LVLMs无法以实现流畅交流的方式交互式地生成和解析指称表达式,这是人类语言使用的关键技能。我们发布了包含356段对话(89对,每对4轮)的语料库,以及数据收集的在线流程和分析准确性、效率和词汇重叠的工具。
引用
@article{arxiv.2601.19792,
title = {LVLMs and Humans Ground Differently in Referential Communication},
author = {Peter Zeng and Weiling Li and Amie Paige and Zhengxiang Wang and Panagiotis Kaliosis and Dimitris Samaras and Gregory Zelinsky and Susan Brennan and Owen Rambow},
journal= {arXiv preprint arXiv:2601.19792},
year = {2026}
}
备注
27 pages, 16 figures