GraphVQA:用于基于图的图像视觉问答的语言引导图神经网络
计算与语言
2021-06-03 v2 计算机视觉与模式识别
摘要
图像不仅仅是物体或属性的集合——它们代表了相互关联物体之间的关系网。场景图(scene graph)已成为一种用于图像结构化图形表示的新模态。场景图将物体编码为节点,通过成对关系作为边连接。为支持基于场景图的问答,我们提出 GraphVQA,一种语言引导的图神经网络框架,它将自然语言问题翻译并执行为图节点间多次迭代的消息传递。我们探索了 GraphVQA 框架的设计空间,并讨论了不同设计选择的权衡。我们在 GQA 数据集上的实验表明,GraphVQA 以较大优势优于最先进模型(88.43% 对比 94.78%)。
引用
@article{arxiv.2104.10283,
title = {GraghVQA: Language-Guided Graph Neural Networks for Graph-based Visual Question Answering},
author = {Weixin Liang and Yanhao Jiang and Zixuan Liu},
journal= {arXiv preprint arXiv:2104.10283},
year = {2021}
}
备注
NAACL 2021 MAI-Workshop. Code available at https://github.com/codexxxl/GraphVQA