中文

MAttNet:用于指代表达理解的模块化注意力网络

计算机视觉与模式识别 2018-03-28 v3 人工智能 计算与语言

摘要

在本文中,我们解决指代表达理解问题:定位由自然语言表达式描述的图像区域。虽然最近大多数工作将表达式视为单一单元,我们提出将其分解为与主体外观、位置以及与其他对象的关系相关的三个模块化组件。这使我们能够在一个端到端框架中灵活适应包含不同类型信息的表达式。在我们的模型中,我们称之为模块化注意力网络(MAttNet),利用了两类注意力:基于语言的注意力,学习模块权重以及每个模块应关注的词/短语注意力;以及视觉注意力,使主体和关系模块能够聚焦于相关图像组件。模块权重动态结合所有三个模块的分数以输出总体分数。实验表明,MAttNet 在边界框级和像素级理解任务上均以大幅优势超越先前的最先进方法。我们提供了演示和代码。

关键词

引用

@article{arxiv.1801.08186,
  title  = {MAttNet: Modular Attention Network for Referring Expression Comprehension},
  author = {Licheng Yu and Zhe Lin and Xiaohui Shen and Jimei Yang and Xin Lu and Mohit Bansal and Tamara L. Berg},
  journal= {arXiv preprint arXiv:1801.08186},
  year   = {2018}
}

备注

Equation of word attention fixed; MAttNet+Grabcut results added