中文

面向视觉问答的聚焦视觉-文本注意力

计算机视觉与模式识别 2019-06-04 v2

摘要

近期关于语言与视觉结合神经网络的见解已成功应用于简单的单图像视觉问答。然而,要处理如个人照片等多媒体集合上的现实问答问题,我们必须考察包含照片或视频序列的整个集合。当从大型集合中回答问题时,一个自然的问题是如何识别支持答案的片段。本文描述了一种称为聚焦视觉-文本注意力网络(FVTA)的新型神经网络,用于视觉问答中的集体推理,其中同时呈现视觉与文本序列信息(如图像和文本元数据)。FVTA引入了一种端到端方法,利用分层处理动态确定在序列数据中应关注哪些媒体以及哪些时刻来回答问题。FVTA不仅能很好地回答问题,还能提供系统得出答案所依据的理由。FVTA在MemexQA数据集上取得了最先进的性能,并在MovieQA数据集上获得了具有竞争力的结果。

关键词

引用

@article{arxiv.1806.01873,
  title  = {Focal Visual-Text Attention for Visual Question Answering},
  author = {Junwei Liang and Lu Jiang and Liangliang Cao and Li-Jia Li and Alexander Hauptmann},
  journal= {arXiv preprint arXiv:1806.01873},
  year   = {2019}
}

备注

In CVPR 2018. Code, models and dataset are available here: https://memexqa.cs.cmu.edu/