ABC-CNN:用于视觉问答的注意力卷积神经网络
计算机视觉与模式识别
2016-04-05 v2
摘要
我们提出了一种用于视觉问答任务(VQA)的新型基于注意力的深度学习架构。给定一张图像和与图像相关的自然语言问题,VQA 为该问题生成自然语言答案。生成正确答案需要模型的注意力集中在与问题对应的区域上,因为不同的问题询问的是不同图像区域的属性。我们引入了一种基于注意力的可配置卷积神经网络(ABC-CNN)来学习这种问题引导的注意力。ABC-CNN 通过将图像特征图与源自问题语义的可配置卷积核进行卷积,为图像-问题对确定注意力图。我们在三个基准 VQA 数据集上评估了 ABC-CNN 架构:Toronto COCO-QA、DAQUAR 和 VQA 数据集。ABC-CNN 模型在这些数据集上比 SOTA 方法取得了显著提升。ABC-CNN 生成的问题引导注意力也被证明反映了与问题高度相关的区域。
引用
@article{arxiv.1511.05960,
title = {ABC-CNN: An Attention Based Convolutional Neural Network for Visual Question Answering},
author = {Kan Chen and Jiang Wang and Liang-Chieh Chen and Haoyuan Gao and Wei Xu and Ram Nevatia},
journal= {arXiv preprint arXiv:1511.05960},
year = {2016}
}