用于视觉问答的互易注意力融合
计算机视觉与模式识别
2021-08-30 v2 人工智能
计算与语言
摘要
现有的注意力机制要么关注局部图像网格特征,要么关注物体级特征以进行视觉问答(VQA)。受问题可同时关联物体实例及其部件这一观察的启发,我们提出了一种新颖的注意力机制,联合考虑两个层级视觉细节间的互易关系。由此生成的自底向上注意力进一步与自顶向下信息融合,以仅聚焦于与给定问题最相关的场景元素。我们的设计通过高效的张量分解方案,分层融合多模态信息,即语言、物体级和网格级特征。所提模型在 VQAv1 上将最优单模型性能从 67.9% 提升至 68.2%,在 VQAv2 上从 65.7% 提升至 67.4%,显示出显著提升。
引用
@article{arxiv.1805.04247,
title = {Reciprocal Attention Fusion for Visual Question Answering},
author = {Moshiur R Farazi and Salman H Khan},
journal= {arXiv preprint arXiv:1805.04247},
year = {2021}
}
备注
To appear in the British Machine Vision Conference (BMVC), September 2018