视觉-语言模型在指代生成任务中缺乏实用主义能力
计算与语言
2025-08-01 v3
摘要
指代生成(REG)是评估视觉-语言系统实用主义能力的核心任务,需要不仅准确的语义 grounding,还要遵循合作通信原理(Grice, 1975)。然而,当前对视觉-语言模型(VLM)的评估常常忽视了实用主义维度,将REG简化为基于区域的描述任务,忽略了Gricean原则。在本工作中,我们从实用主义视角重新审视REG,提出了新的数据集(RefOI),包含1.5k张图片,配有书面和口头指代表达。通过对最先进VLM的系统评估,我们识别出三种实用主义能力失败:(1)无法唯一确定指代对象,(2)包含过多或不相关的信息,(3)与人类实用主义偏好不一致,例如 underutilize 最小空间线索。我们还表明,标准的自动评估未能捕捉这些实用主义违规,强化了表面线索而非真正的指代成功。我们的发现呼吁关注以实用主义为导向的模型和评估框架,以契合真实人类沟通。
引用
@article{arxiv.2504.16060,
title = {Vision-Language Models Are Not Pragmatically Competent in Referring Expression Generation},
author = {Ziqiao Ma and Jing Ding and Xuejun Zhang and Dezhi Luo and Jiahe Ding and Sihan Xu and Yuchen Huang and Run Peng and Joyce Chai},
journal= {arXiv preprint arXiv:2504.16060},
year = {2025}
}
备注
COLM 2025 & CVinW @ CVPR 2025 (Spotlight). Homepage: https://vlm-reg.github.io/