中文

一种用于视觉问答的聚焦动态注意力模型

计算机视觉与模式识别 2016-04-07 v1 计算与语言 神经与进化计算

摘要

视觉问答(VQA)问题正吸引着来自多个研究学科日益增长的兴趣。解决VQA问题需要来自计算机视觉的技术以理解所给图像或视频的视觉内容,以及来自自然语言处理的技术以理解问题语义并生成答案。在视觉内容建模方面,大多数现有VQA方法采用从图像或视频中提取全局特征的策略,这不可避免地难以捕捉细粒度信息,例如多个物体的空间配置。从自动生成区域提取特征——正如一些基于区域的图像识别方法所做的那样——不能从根本上解决这个问题,并可能引入一些与问题无关的压倒性特征。在这项工作中,我们提出一种新颖的聚焦动态注意力(FDA)模型,以提供更与所提问题对齐的图像内容表示。意识到问题中的关键词,FDA采用现成的目标检测器来识别重要区域,并通过一个LSTM单元融合来自区域和全局特征的信息。这种问题驱动的表示随后与问题表示结合,并输入推理单元以生成答案。在一个大规模基准数据集VQA上的广泛评估清楚地证明了FDA相对于成熟基线方法的优越性能。

关键词

引用

@article{arxiv.1604.01485,
  title  = {A Focused Dynamic Attention Model for Visual Question Answering},
  author = {Ilija Ilievski and Shuicheng Yan and Jiashi Feng},
  journal= {arXiv preprint arXiv:1604.01485},
  year   = {2016}
}

备注

Submitted to ECCV 2016