中文

迈向人类全局语境:视觉-语言模型真的像人类一样判断吗?

计算机视觉与模式识别 2022-07-25 v1

摘要

随着计算机视觉与自然语言处理的进步,视觉-语言(VL)正成为一个重要的研究领域。尽管重要,该研究领域的评估指标仍处于初步发展阶段。本文提出一种量化指标“等变分数”(Equivariance Score)与评估数据集“人类谜题”(Human Puzzle),用以评估VL模型是否像人类一样理解图像。我们观察到,VL模型并不解释输入图像的整体语境,而是表现出对构成局部语境的特定物体或形状的偏置。我们旨在定量衡量模型理解语境的性能。为验证现有VL模型的能力,我们将原始输入图像切片并随机放置,扭曲图像的全局语境。本文讨论了各VL模型对全局语境的理解程度,并阐明了结构特征如何影响结果。

关键词

引用

@article{arxiv.2207.08333,
  title  = {Towards the Human Global Context: Does the Vision-Language Model Really Judge Like a Human Being?},
  author = {Sangmyeong Woh and Jaemin Lee and Ho Joong Kim and Jinsuk Lee},
  journal= {arXiv preprint arXiv:2207.08333},
  year   = {2022}
}