中文

面向多模态问答的多模态图Transformer

计算机视觉与模式识别 2023-05-02 v1 人工智能 计算与语言

摘要

尽管Transformer模型在视觉与语言任务上取得成功,它们常从海量数据中隐式学习知识,且无法直接利用结构化输入数据。另一方面,融合先验信息的结构化学习方法如图神经网络(GNNs)几乎难以与Transformer模型竞争。本工作中,我们旨在兼取两者之长,提出一种新颖的用于需跨多模态推理的问答任务的多模态图Transformer。我们引入一种图参与的即插即用准注意力机制,将从文本与视觉数据获取的多模态图信息作为有效先验整合进原始自注意力中。具体地,我们构建文本图、密集区域图与语义图以生成邻接矩阵,再将其与输入视觉及语言特征组合以执行下游推理。这种以图信息正则化自注意力的方法显著提升了推断能力,并有助于对齐来自不同模态的特征。我们在GQA、VQAv2与MultiModalQA数据集上验证了多模态图Transformer相对于其Transformer基线的有效性。

关键词

引用

@article{arxiv.2305.00581,
  title  = {Multimodal Graph Transformer for Multimodal Question Answering},
  author = {Xuehai He and Xin Eric Wang},
  journal= {arXiv preprint arXiv:2305.00581},
  year   = {2023}
}