Mucko:面向基于事实的视觉问答的多层跨模态知识推理
计算机视觉与模式识别
2020-11-05 v3 人工智能
计算与语言
机器学习
摘要
基于事实的视觉问答(FVQA)需要超出可见内容的外部知识来回答关于图像的问题,这对于实现通用 VQA 而言具有挑战性但不可或缺。现有 FVQA 解决方案的一个局限在于它们不加细粒度筛选地联合嵌入各类信息,从而为最终答案的推理引入了非预期噪声。如何捕获面向问题且信息互补的证据仍是解决该问题的关键挑战。本文中,我们通过多模态异构图描绘图像,该图包含对应于视觉、语义与事实特征的多层信息。基于该多层图表示,我们提出一种模态感知异构图卷积网络,以捕获来自不同层且与给定问题最相关的证据。具体而言,模态内图卷积从各模态中筛选证据,跨模态图卷积聚合不同模态间的相关信息。通过多次堆叠该过程,我们的模型执行迭代推理并通过分析所有面向问题的证据预测最优答案。我们在 FVQA 任务上取得了新的 SOTA 性能,并通过大量实验证明了我们模型的有效性与可解释性。
引用
@article{arxiv.2006.09073,
title = {Mucko: Multi-Layer Cross-Modal Knowledge Reasoning for Fact-based Visual Question Answering},
author = {Zihao Zhu and Jing Yu and Yujing Wang and Yajing Sun and Yue Hu and Qi Wu},
journal= {arXiv preprint arXiv:2006.09073},
year = {2020}
}