中文

窥视 VQA 模型:用子问题内省视觉问答模型

计算机视觉与模式识别 2020-06-17 v2 人工智能 计算与语言 机器学习

摘要

现有的 VQA 数据集包含复杂度各异的问题。虽然这些数据集中的大多数问题需要感知以识别实体的存在、属性和空间关系,但相当一部分问题提出了对应于推理任务的挑战——这些任务只能通过感知与世界知识、逻辑和/或推理的综合来回答。跨此区分分析性能使我们能够注意到现有 VQA 模型何时存在一致性问题;它们正确回答推理问题,却在相关的低级感知问题上失败。例如,在图 1 中,模型正确回答了复杂的推理问题“香蕉够熟可以吃吗?”,却在相关的感知问题“香蕉主要是绿色还是黄色?”上失败,表明模型可能出于错误原因答对了推理问题。我们通过创建 VQA 数据集的一个新推理划分(Reasoning split)并收集 VQA-introspect(一个新数据集1,包含 238K 个新感知问题,作为对应于有效回答推理划分中复杂推理问题所需感知任务集合的子问题)来量化此现象发生的程度。我们的评估表明,最先进的 VQA 模型在回答感知和推理问题上表现相当,但存在一致性问题。为解决此缺陷,我们提出一种称为子问题重要性感知网络调优(SQuINT)的方法,它鼓励模型在回答推理问题和感知子问题时关注图像的相同区域。我们表明 SQuINT 将模型一致性提高了约 5%,也边际改善了 VQA 中推理问题的性能,同时显示出更好的注意力图。

关键词

引用

@article{arxiv.2001.06927,
  title  = {SQuINTing at VQA Models: Introspecting VQA Models with Sub-Questions},
  author = {Ramprasaath R. Selvaraju and Purva Tendulkar and Devi Parikh and Eric Horvitz and Marco Ribeiro and Besmira Nushi and Ece Kamar},
  journal= {arXiv preprint arXiv:2001.06927},
  year   = {2020}
}

备注

Accepted to CVPR'20 as an Oral Presentation