中文

协同注意力 Transformer 层在视觉问答中的有效性研究

计算机视觉与模式识别 2022-01-12 v1 机器学习

摘要

近年来,多模态 Transformer 在视觉-语言任务(如视觉问答(VQA))中取得显著进展,大幅超越先前架构。VQA 的这一改进常归因于视觉与语言流之间的丰富交互。本文中,我们研究协同注意力 Transformer 层在帮助网络回答问题时聚焦于相关区域的有效性。我们利用这些协同注意力层中问题条件的图像注意力分数生成视觉注意力图。我们评估以下关键组件对最先进 VQA 模型视觉注意力的影响:(i) 物体区域提议数量,(ii) 问题词性(POS)标签,(iii) 问题语义,(iv) 协同注意力层数量,以及 (v) 答案准确率。我们将神经网络注意力图与人类注意力图在定性与定量上进行比较。我们的发现表明协同注意力 Transformer 模块在给定问题时关注图像相关区域至关重要。重要的是,我们观察到驱动视觉注意力的并非问题语义,而是问题中的特定关键词。我们的工作阐明了协同注意力 Transformer 层的功能与解释,突显了当前网络的不足,并可指导未来同时处理视觉与语言流的 VQA 模型与网络的开发。

关键词

引用

@article{arxiv.2201.03965,
  title  = {On the Efficacy of Co-Attention Transformer Layers in Visual Question Answering},
  author = {Ankur Sikarwar and Gabriel Kreiman},
  journal= {arXiv preprint arXiv:2201.03965},
  year   = {2022}
}