面向视觉问答特征融合的双边跨模态图匹配注意力
计算机视觉与模式识别
2021-12-15 v1
摘要
在视觉问答(VQA)任务中,根据图像回答语义复杂的问题具有挑战性。尽管图像可通过深度学习得到良好表征,但问题往往仅被简单嵌入,无法充分表达其含义。此外,视觉与文本特征因模态不同而存在鸿沟,难以对齐并利用跨模态信息。本文针对这两个问题提出了图匹配注意力(GMA)网络。首先,该网络不仅为图像构建图,还基于句法与嵌入信息为问题构建图。接着,我们通过双阶段图编码器探索模态内关系,进而提出双边跨模态图匹配注意力来推断图像与问题之间的关系。更新后的跨模态特征被送入答案预测模块以进行最终答案预测。实验表明,我们的网络在GQA数据集与VQA 2.0数据集上取得了最先进的性能。消融研究验证了GMA网络中各模块的有效性。
引用
@article{arxiv.2112.07270,
title = {Bilateral Cross-Modality Graph Matching Attention for Feature Fusion in Visual Question Answering},
author = {JianJian Cao and Xiameng Qin and Sanyuan Zhao and Jianbing Shen},
journal= {arXiv preprint arXiv:2112.07270},
year = {2021}
}
备注
pre-print, TNNLS, 12 pages