中文

VAGUE:视觉上下文消解模糊表达

计算机视觉与模式识别 2025-08-27 v3 计算与语言

摘要

人类交流常依赖视觉线索消解歧义性。虽然人类能直观地整合这些线索,但人工智能系统在进行复杂多模态推理时常感到困难。我们提出 VAGUE,一个评估多模态AI系统整合视觉上下文以消解意图歧义的基准。VAGUE包含1.6K个模糊文本表达,每个表达配有图像和多选解释选项,只有在视觉上下文的帮助下才能显现正确答案。数据集涵盖both staged, complex (Visual Commonsense Reasoning) 和 natural, personal (Ego4D) 场景,确保多样性。我们的实验表明,现有多模态AI模型在推断说话者真实意图方面表现不佳。尽管性能随视觉线索的增加而持续提升,但总体准确率仍远低于人类水平,这凸显了多模态推理中的关键差距。对失败案例的分析显示,当前模型无法区分真实意图与视觉场景中表面的相关性,表明它们感知图像但未能有效地进行推理。我们将在 https://hazel-heejeong-nam.github.io/vague/ 上发布代码和数据。

关键词

引用

@article{arxiv.2411.14137,
  title  = {VAGUE: Visual Contexts Clarify Ambiguous Expressions},
  author = {Heejeong Nam and Jinwoo Ahn and Keummin Ka and Jiwan Chung and Youngjae Yu},
  journal= {arXiv preprint arXiv:2411.14137},
  year   = {2025}
}

备注

ICCV 2025, 32 pages