中文

可解释的高阶视觉问答推理:新基准与知识路由网络

计算机视觉与模式识别 2019-09-24 v1

摘要

解释能力与高阶推理能力对于具有不同推理复杂度的真实世界视觉问答(例如,靠近正在玩耍的女孩的狗是什么?)至关重要,且有助于用户理解并诊断系统的可信度。当前基于自然图像的 VQA 基准仅采用准确率指标,最终促使模型利用数据集偏差,且无法提供任何可解释的论证,这严重阻碍了高阶问答的进展。本工作中,我们提出一个新的 HVQR 基准,用于评估可解释的高阶视觉问答推理能力,具有三个显著优点:1)问题常包含一个或两个关系三元组,要求模型具备多步推理能力以预测合理答案;2)我们对由图像场景图与常识知识库构建的多步推理过程提供显式评估;3)大规模知识库中每个关系三元组在所有问题中仅出现一次,这对现有常试图过拟合训练集中已出现知识库的网络提出挑战,并迫使模型处理未见问题与知识事实运用。我们还提出一种新的知识路由模块化网络(KM-net),将大规模知识库上的多步推理过程融入视觉问答推理。在 HVQR 基准上的广泛数据集分析以及与现有模型的比较表明,我们的基准提供了可解释评估、全面的推理需求与 VQA 系统的现实挑战,且我们的 KM-net 在准确率与解释能力上具有优越性。

关键词

引用

@article{arxiv.1909.10128,
  title  = {Explainable High-order Visual Question Reasoning: A New Benchmark and Knowledge-routed Network},
  author = {Qingxing Cao and Bailin Li and Xiaodan Liang and Liang Lin},
  journal= {arXiv preprint arXiv:1909.10128},
  year   = {2019}
}