基于动态键值记忆增强多步图推理的知识型视觉问答
计算机视觉与模式识别
2022-03-08 v1 人工智能
计算与语言
摘要
知识型视觉问答(VQA)是一项视觉-语言任务,要求智能体利用给定图像中未呈现的知识正确回答与图像相关的问题。它不仅比常规 VQA 更具挑战性,也是构建通用 VQA 系统的重要一步。大多数现有的知识型 VQA 系统以相似方式处理知识和图像信息,忽略了知识库(KB)包含三元组的完整信息,而提取的图像信息可能不完整(因为两个对象之间的关系可能缺失或被错误检测)。本文提出一种名为动态知识记忆增强多步图推理(DMMGR)的新模型,分别在键值知识记忆模块和空间感知图像图上进行显式与隐式推理。具体而言,记忆模块在每一步推理中学习动态知识表示并生成知识感知的问题表示。然后,该表示用于引导对空间感知图像图的图注意力操作。我们的模型在 KRVQR 和 FVQA 数据集上取得了新的 SOTA 准确率。我们还进行了消融实验以证明所提模型各组件的有效性。
引用
@article{arxiv.2203.02985,
title = {Dynamic Key-value Memory Enhanced Multi-step Graph Reasoning for Knowledge-based Visual Question Answering},
author = {Mingxiao Li and Marie-Francine Moens},
journal= {arXiv preprint arXiv:2203.02985},
year = {2022}
}