中文

VQA-GNN:通过图神经网络融合多模态知识进行视觉问答推理

计算机视觉与模式识别 2023-09-18 v2 人工智能 计算与语言

摘要

视觉问答(VQA)要求系统通过统一非结构化(例如问题和答案中的上下文;“QA 上下文”)和结构化(例如 QA 上下文和场景的知识图;“概念图”)多模态知识来进行概念级推理。现有工作通常通过将对应的视觉节点和概念节点连接来组合场景图和场景的概念图,然后融入 QA 上下文表示以执行问答。然而,这些方法仅执行从非结构化知识到结构化知识的单向融合,限制了它们在异构知识模态上联合推理的潜力。为进行更具表达力的推理,我们提出 VQA-GNN,一种在 unstructured 和 structured 多模态知识之间执行双向融合以获得统一知识表示的新 VQA 模型。具体而言,我们通过一个表示 QA 上下文的超级节点互连场景图和概念图,并引入一种新的多模态 GNN 技术来执行跨模态消息传递推理,从而缓解模态间的表示鸿沟。在两个具有挑战性的 VQA 任务(VCR 和 GQA)上,我们的方法分别以 3.2% 和 4.6% 优于强基线 VQA 方法,表明其在概念级推理上的优势。消融研究进一步证明了双向融合和多模态 GNN 方法在统一非结构化和结构化多模态知识上的有效性。

关键词

引用

@article{arxiv.2205.11501,
  title  = {VQA-GNN: Reasoning with Multimodal Knowledge via Graph Neural Networks for Visual Question Answering},
  author = {Yanan Wang and Michihiro Yasunaga and Hongyu Ren and Shinya Wada and Jure Leskovec},
  journal= {arXiv preprint arXiv:2205.11501},
  year   = {2023}
}

备注

Accepted at ICCV 2023