MGA-VQA:面向视觉问答的多粒度对齐
计算机视觉与模式识别
2022-01-27 v1
摘要
学习回答视觉问题是一项具有挑战性的任务,因为多模态输入处于两个特征空间中。此外,视觉问答中的推理要求模型理解图像与问题,并将它们在同一个空间中对齐,而非简单地记忆有关问题-答案对的统计信息。因此,寻找不同模态之间以及各模态内部的组件关联以实现更好的注意力至关重要。先前的工作直接在特征上学习注意力权重。然而,由于这两个模态特征处于两个域中:图像特征高度多样、缺乏如语言般的结构与语法规则,而自然语言特征缺失细节信息的概率更高,改进十分有限。为了更好地学习视觉与文本之间的注意力,我们聚焦于如何构建输入分层并嵌入结构信息以改善不同层级组件之间的对齐。我们提出了面向视觉问答任务的多粒度对齐架构(MGA-VQA),其通过多粒度对齐学习模态内与模态间关联,并由决策融合模块输出最终结果。与先前工作相比,我们的模型将对齐拆分为不同层级,以在无需额外数据与标注的情况下学习更好的关联。在VQA-v2与GQA数据集上的实验表明,我们的模型在这两个数据集上显著优于非预训练的最先进方法,且无需额外的预训练数据与标注。此外,它在GQA上甚至取得了优于预训练方法的结果。
引用
@article{arxiv.2201.10656,
title = {MGA-VQA: Multi-Granularity Alignment for Visual Question Answering},
author = {Peixi Xiong and Yilin Shen and Hongxia Jin},
journal= {arXiv preprint arXiv:2201.10656},
year = {2022}
}