从像素到对象:面向视觉问答的立体视觉注意力
计算机视觉与模式识别
2022-06-07 v1
摘要
近来,基于注意力的视觉问答(VQA)通过利用问题选择性地定位与答案相关的不同视觉区域而取得巨大成功。现有视觉注意力模型一般是平面的,即图像最后卷积层特征图的不同通道共享相同权重。这与注意力机制相冲突,因为 CNN 特征天然是空间性与通道性的。此外,视觉注意力模型通常在像素级进行,可能导致区域不连续问题。本文中,我们提出一种立体视觉注意力(CVA)模型,成功地将新颖的通道与空间注意力应用于对象区域以改进 VQA 任务。具体而言,我们不直接关注像素,而是首先利用对象提议网络生成一组对象候选并提取其关联的卷积特征。然后,我们利用问题基于卷积层特征图引导通道注意力与空间注意力的计算。最后,将受关注的视觉特征与问题结合以推断答案。我们在三个公开图像问答数据集(包括 COCO-QA、VQA 与 Visual7W)上评估所提 CVA 的性能。实验结果表明,我们的方法显著优于当前最优方法。
引用
@article{arxiv.2206.01923,
title = {From Pixels to Objects: Cubic Visual Attention for Visual Question Answering},
author = {Jingkuan Song and Pengpeng Zeng and Lianli Gao and Heng Tao Shen},
journal= {arXiv preprint arXiv:2206.01923},
year = {2022}
}