中文

在VQA中度量忠实且合理的视觉接地

计算机视觉与模式识别 2024-01-17 v2

摘要

视觉问答(VQA)系统中视觉接地(VG)的度量主要旨在衡量系统推断给定问题答案时对图像相关部分的依赖程度。缺乏VG一直是先进VQA系统的普遍问题,可表现为对无关图像部分的过度依赖或完全忽视视觉模态。尽管VQA模型的推理能力常由少量定性图示说明,多数系统并未就其VG特性做定量评估。我们认为,一个易于计算且能有意义度量系统VG的准则可助弥补此不足,并为模型评估与分析增添宝贵维度。为此,我们提出一个新VG度量,捕获模型是否a)识别场景中问题相关对象,且b)生成答案时确实依赖相关对象所含信息,即其视觉接地是否既“忠实”又“合理”。我们的度量称为“忠实且合理的视觉接地”(FPVG),对多数VQA模型设计可直接判定。我们详述FPVG并评估了涵盖多种VQA架构的数个参考系统。支持GQA数据集上度量计算的代码发布于GitHub。

关键词

引用

@article{arxiv.2305.15015,
  title  = {Measuring Faithful and Plausible Visual Grounding in VQA},
  author = {Daniel Reich and Felix Putze and Tanja Schultz},
  journal= {arXiv preprint arXiv:2305.15015},
  year   = {2024}
}