超图 Transformer:面向知识视觉问答的弱监督多跳推理
计算机视觉与模式识别
2022-04-25 v1 人工智能
计算与语言
机器学习
摘要
基于知识的视觉问答(QA)旨在回答需要超越图像内容本身、以视觉为 grounding 的外部知识的问题。在弱监督下回答需要多跳推理的复杂问题被认为是一项具有挑战性的难题,因为 i) 推理过程无监督信号,且 ii) 需要捕捉多跳知识事实的高阶语义。本文引入超图概念来编码问题及知识库的高层语义,并学习二者之间的高阶关联。所提模型 Hypergraph Transformer 构建问题超图与查询感知的知识超图,并通过编码两个超图之间的相互关联以及各超图内部的内在关联来推断答案。在两个基于知识的视觉 QA 与两个基于知识的文本 QA 上的大量实验证明了本方法的有效性,尤其针对多跳推理问题。我们的源代码发布于 https://github.com/yujungheo/kbvqa-public。
引用
@article{arxiv.2204.10448,
title = {Hypergraph Transformer: Weakly-supervised Multi-hop Reasoning for Knowledge-based Visual Question Answering},
author = {Yu-Jung Heo and Eun-Sol Kim and Woo Suk Choi and Byoung-Tak Zhang},
journal= {arXiv preprint arXiv:2204.10448},
year = {2022}
}
备注
Accepted at ACL 2022