中文

用于多模态推理与匹配的双重注意力网络

计算机视觉与模式识别 2017-03-22 v2

摘要

我们提出双重注意力网络(DANs),其联合利用视觉和文本注意力机制来捕获视觉与语言之间的细粒度相互作用。DANs 通过多个步骤关注图像中的特定区域和文本中的单词,并从两种模态中收集本质信息。基于此框架,我们分别引入了两种用于多模态推理与匹配的 DANs。推理模型允许视觉和文本注意力在协同推断过程中相互引导,这对于视觉问答(VQA)等任务十分有用。此外,匹配模型利用这两种注意力机制,通过聚焦于图像与句子的共享语义来估计它们之间的相似度。我们大量的实验验证了 DANs 在结合视觉与语言方面的有效性,在 VQA 和图文匹配的公开基准上取得了最先进的性能。

关键词

引用

@article{arxiv.1611.00471,
  title  = {Dual Attention Networks for Multimodal Reasoning and Matching},
  author = {Hyeonseob Nam and Jung-Woo Ha and Jeonghee Kim},
  journal= {arXiv preprint arXiv:1611.00471},
  year   = {2017}
}