基于自注意力与协同注意力级联块的视觉问答模型
计算机视觉与模式识别
2023-03-01 v1 人工智能
摘要
复杂注意力模块的使用提升了视觉问答(VQA)任务的性能。本工作旨在通过图像与文本模态的密集交互学习改进的多模态表示。所提模型包含一个注意力块,其中对图像和文本同时施加自注意力与协同注意力。自注意力模块提供物体(图像中)与单词(问题中)的上下文信息,这些信息对推断答案至关重要。另一方面,协同注意力有助于图像与文本的交互。此外,通过使用自注意力与协同注意力级联块(CSCA)从两种模态中获取细粒度信息。该方案在广泛使用的 VQA2.0 与 TDIUC 数据集上进行了基准测试。通过涉及消融分析的试验,证明了模型关键组件及注意力模块级联的有效性。
引用
@article{arxiv.2302.14777,
title = {VQA with Cascade of Self- and Co-Attention Blocks},
author = {Aakansha Mishra and Ashish Anand and Prithwijit Guha},
journal= {arXiv preprint arXiv:2302.14777},
year = {2023}
}