中文

基于属性与注意力机制的视觉到语言任务

计算机视觉与模式识别 2019-05-30 v1

摘要

视觉到语言任务旨在将计算机视觉与自然语言处理相融合,已引起众多研究者的关注。典型方法将图像编码为特征表示并解码为自然语言句子,却忽略了高层语义概念以及图像区域与自然语言元素之间的细微关联。为充分利用这些信息,本文尝试利用文本引导注意力与语义引导注意力(SA)来寻找更相关的空间信息并缩小视觉与语言间的语义鸿沟。我们的方法包含两级注意力网络:一是文本引导注意力网络,用于选择文本相关区域;二是 SA 网络,用于突出概念相关区域与区域相关概念。最后,所有信息被整合以生成描述或答案。我们在图像描述与视觉问答任务上进行了实验,结果表明所提方法具有优异性能。

关键词

引用

@article{arxiv.1905.12243,
  title  = {Vision-to-Language Tasks Based on Attributes and Attention Mechanism},
  author = {Xuelong Li and Aihong Yuan and Xiaoqiang Lu},
  journal= {arXiv preprint arXiv:1905.12243},
  year   = {2019}
}

备注

15 pages, 6 figures, 50 references