中文

衡量 VLMs 构建共识的方式(不仅仅是是否如此)

计算与语言 2025-09-05 v1 人工智能

摘要

大型视觉语言模型(VLMs)日益声称拥有推理能力,但当前基准仅评估单轮或问答情境下的模型。然而, grounding 是一种交互过程,人们通过持续的交流逐步发展共同的理解。我们引入四度量指标体系(grounding efficiency、content alignment、lexical adaptation 和 human-likeness),系统评估 VLMs 在交互式 grounding 场景中的表现。我们在 150 场自我对弈的交互式 referential 游戏中部署该指标体系,对比了三种专有 VLMs 与人类配对。所有三种模型在至少三个指标上都偏离了人类的模式,GPT4o-mini 综合最接近。我们发现(i)任务成功分数不指示成功的 grounding,(ii)高的图像-言语 alignment 不一定预测任务成功。我们的度量体系和发现为 VLMs grounding 的未来研究提供了框架。

关键词

引用

@article{arxiv.2509.03805,
  title  = {Measuring How (Not Just Whether) VLMs Build Common Ground},
  author = {Saki Imai and Mert İnan and Anthony Sicilia and Malihe Alikhani},
  journal= {arXiv preprint arXiv:2509.03805},
  year   = {2025}
}