中文

FVQA:基于事实的视觉问答

计算机视觉与模式识别 2017-08-09 v4

摘要

视觉问答(Visual Question Answering, VQA)在计算机视觉和自然语言处理领域引起了广泛关注,这不仅是因为它提供了对两个重要信息源之间关系的洞察。当前的数据集及建立在其上的模型,主要关注仅通过直接分析问题和图像即可回答的问题。这类无需外部信息即可回答的问题集合虽然有趣,但非常有限。例如,它排除了需要常识或基础事实知识才能回答的问题。在此我们引入 FVQA,一个需要并支持更深层推理的 VQA 数据集。FVQA 仅包含需要外部信息才能回答的问题。因此,我们通过增加图像-问题-答案-支持事实四元组,对包含图像-问题-答案三元组的传统视觉问答数据集进行了扩展。支持事实被表示为结构三元组,例如 <Cat, CapableOf, ClimbingTrees>。我们在 FVQA 数据集上评估了几个基线模型,并描述了一个能够基于支持事实对图像进行推理的新模型。

关键词

引用

@article{arxiv.1606.05433,
  title  = {FVQA: Fact-based Visual Question Answering},
  author = {Peng Wang and Qi Wu and Chunhua Shen and Anton van den Hengel and Anthony Dick},
  journal= {arXiv preprint arXiv:1606.05433},
  year   = {2017}
}

备注

16 pages