中文

面向视觉问答的对象图与关系图联合学习

计算机视觉与模式识别 2022-05-10 v1 多媒体

摘要

通过场景图对视觉问答(VQA)进行建模可显著提升推理准确性与可解释性。然而,现有模型在应对涉及属性或关系的复杂推理问题时表现不佳,导致如图1(a)中所示的属性选择错误 or 关系缺失。这是因为这些模型无法平衡场景图中的各类信息,忽视了关系与属性信息。本文提出一种新颖的双重消息传递增强图神经网络(DM-GNN),可通过合理编码多尺度场景图信息获得均衡表示。具体而言,我们(i)将场景图转化为两个分别侧重对象与关系的图;随后设计双重结构对二者进行编码,提升了来自关系的权重;(ii)将编码器输出与属性特征融合,提升了来自属性的权重;(iii)提出一种消息传递机制以增强对象、关系与属性间的信息传递。我们在包括GQA、VG、motif-VG在内的数据集上进行了充分实验,取得了新的SOTA。

关键词

引用

@article{arxiv.2205.04188,
  title  = {Joint learning of object graph and relation graph for visual question answering},
  author = {Hao Li and Xu Li and Belhal Karimi and Jie Chen and Mingming Sun},
  journal= {arXiv preprint arXiv:2205.04188},
  year   = {2022}
}

备注

6 pages, 4 figures, Accepted by ICME 2022