FVQA:基于事实的视觉问答
计算机视觉与模式识别
2017-08-09 v4
摘要
视觉问答(Visual Question Answering, VQA)在计算机视觉和自然语言处理领域引起了广泛关注,这不仅是因为它提供了对两个重要信息源之间关系的洞察。当前的数据集及建立在其上的模型,主要关注仅通过直接分析问题和图像即可回答的问题。这类无需外部信息即可回答的问题集合虽然有趣,但非常有限。例如,它排除了需要常识或基础事实知识才能回答的问题。在此我们引入 FVQA,一个需要并支持更深层推理的 VQA 数据集。FVQA 仅包含需要外部信息才能回答的问题。因此,我们通过增加图像-问题-答案-支持事实四元组,对包含图像-问题-答案三元组的传统视觉问答数据集进行了扩展。支持事实被表示为结构三元组,例如 <Cat, CapableOf, ClimbingTrees>。我们在 FVQA 数据集上评估了几个基线模型,并描述了一个能够基于支持事实对图像进行推理的新模型。
引用
@article{arxiv.1606.05433,
title = {FVQA: Fact-based Visual Question Answering},
author = {Peng Wang and Qi Wu and Chunhua Shen and Anton van den Hengel and Anthony Dick},
journal= {arXiv preprint arXiv:1606.05433},
year = {2017}
}
备注
16 pages