CommVQA:将视觉问答置于交际语境中
计算与语言
2024-10-07 v2 计算机视觉与模式识别
摘要
当前的视觉问答(VQA)模型通常是在孤立的图像-问题对上进行训练和评估的。然而,人们提出的问题取决于他们的信息需求和对图像内容的先验知识。为了评估将图像置于自然语境中如何塑造视觉问题,我们引入了CommVQA,这是一个由图像、图像描述、图像可能出现的真实世界交际场景(例如旅游网站)以及基于场景和描述提出的后续问题和答案组成的VQA数据集。CommVQA包含1000张图像和8949个问题-答案对,对当前模型构成了挑战。错误分析和一项人类受试者研究表明,生成的答案仍然包含高比例的幻觉,未能恰当地处理无法回答的问题,并且没有适当地反映上下文信息。总体而言,我们表明,获取上下文信息对于解决CommVQA至关重要,这导致了性能最高的VQA模型,并凸显了将系统置于交际场景中的相关性。
引用
@article{arxiv.2402.15002,
title = {CommVQA: Situating Visual Question Answering in Communicative Contexts},
author = {Nandita Shankar Naik and Christopher Potts and Elisa Kreiss},
journal= {arXiv preprint arXiv:2402.15002},
year = {2024}
}
备注
EMNLP 2024 camera ready version