中文

Context-VQA:迈向上下文感知且有目的的视觉问答

计算与语言 2023-08-31 v2 计算机视觉与模式识别

摘要

视觉问答(VQA)有潜力以交互方式使互联网更易访问,使无法看见图像的人能够就图像提问。然而,多项研究表明,盲人或低视力者更倾向于包含图像所处上下文的图像解释,而当前的 VQA 数据集仅关注孤立的图像。我们认为,除非考虑上下文,否则 VQA 模型无法完全满足人们的需求。为了进一步激发并分析不同上下文之间的区别,我们引入了 Context-VQA,这是一个将图像与上下文(具体为网站类型,如购物网站)配对的 VQA 数据集。我们发现问题的类型在不同上下文中系统性地变化。例如,在旅行上下文中呈现的图像会引发两倍以上的“哪里?”问题,而社交媒体和新闻中的图像引发的“谁?”问题分别是平均值的 2.8 倍和 1.8 倍。我们还发现,当参与者无法看见图像时,上下文效应尤为重要。这些结果表明,上下文影响所提问题的类型,且 VQA 模型应具备上下文敏感性,以更好地满足人们的需求,尤其是在无障碍场景中。

关键词

引用

@article{arxiv.2307.15745,
  title  = {Context-VQA: Towards Context-Aware and Purposeful Visual Question Answering},
  author = {Nandita Naik and Christopher Potts and Elisa Kreiss},
  journal= {arXiv preprint arXiv:2307.15745},
  year   = {2023}
}

备注

Proceedings of ICCV 2023 Workshop on Closing the Loop Between Vision and Language