中文

理解视觉问答中的知识鸿沟:对鸿沟识别与测试的意义

计算与语言 2020-06-05 v2 人工智能 计算机视觉与模式识别

摘要

视觉问答(VQA)系统的任务是回答与所呈现图像对应的自然语言问题。传统 VQA 数据集通常包含与物体空间信息、物体属性或一般场景问题相关的问题。近来,研究者认识到需要改善此类数据集的平衡性,以减少系统对记忆语言特征与统计偏差的依赖,同时旨在增强视觉理解。然而,是否存在可量化并解释这些失败的潜在模式尚不清楚。作为更好量化我们对 VQA 模型性能理解的初步步骤,我们使用知识鸿沟(KGs)分类法为问题标注一个或多个类型的 KG。每个知识鸿沟(KG)描述了得出解答所需的推理能力。在识别每个问题的 KG 后,我们考察了各 KG 问题分布的偏斜。随后我们引入一种有针对性的问题生成模型来减少此偏斜,其允许我们为图像生成新型问题。这些新问题可加入现有 VQA 数据集以增加问题多样性并减少偏斜。

关键词

引用

@article{arxiv.2004.03755,
  title  = {Understanding Knowledge Gaps in Visual Question Answering: Implications for Gap Identification and Testing},
  author = {Goonmeet Bajaj and Bortik Bandyopadhyay and Daniel Schmidt and Pranav Maneriker and Christopher Myers and Srinivasan Parthasarathy},
  journal= {arXiv preprint arXiv:2004.03755},
  year   = {2020}
}