一种改进的可视化问答注意力机制
计算机视觉与模式识别
2021-06-07 v3 计算与语言
摘要
我们考虑可视化问答(VQA)问题。给定一幅图像及以自然语言表述的自由形式、开放式问题,VQA系统的目标是针对该图像准确回答此问题。该任务具有挑战性,因为它需要同时且精细地理解视觉与文本信息。注意力机制通过捕捉模态内与模态间依赖关系,已成为应对这些挑战或许最广泛使用的机制。本文提出一种改进的基于注意力的架构来解决VQA。我们在编码器-解码器框架中引入注意力之上的注意力(AoA)模块,其能够判定注意力结果与查询之间的关系。注意力模块为每个查询生成加权平均值。另一方面,AoA模块首先利用注意力结果与当前上下文生成信息向量与注意力门;随后施加另一注意力,通过将二者相乘生成最终注意力信息。我们还提出多模态融合模块以结合视觉与文本信息。该融合模块的目标是动态决定各模态应被考虑的信息量。在VQA-v2基准数据集上的大量实验表明,我们的方法达到了最先进(SOTA)性能。
引用
@article{arxiv.2011.02164,
title = {An Improved Attention for Visual Question Answering},
author = {Tanzila Rahman and Shih-Han Chou and Leonid Sigal and Giuseppe Carenini},
journal= {arXiv preprint arXiv:2011.02164},
year = {2021}
}
备注
8 pages