中文

注意力上的注意力:用于视觉问答(VQA)的架构

计算与语言 2018-03-22 v1 人工智能 计算机视觉与模式识别

摘要

视觉问答(VQA)是深度学习研究中日益热门的主题,需要将自然语言处理和计算机视觉模块协调到一个单一架构中。我们在 VQA Challenge 中获得第一名的模型基础上,开发了十三种新的注意力机制并引入了一个简化的分类器。我们进行了 300 GPU 小时的广泛超参数和架构搜索,实现了 64.78% 的评估得分,超越了现有 SOTA 单模型 63.15% 的验证得分。

关键词

引用

@article{arxiv.1803.07724,
  title  = {Attention on Attention: Architectures for Visual Question Answering (VQA)},
  author = {Jasdeep Singh and Vincent Ying and Alex Nutkiewicz},
  journal= {arXiv preprint arXiv:1803.07724},
  year   = {2018}
}

备注

Visual Question Answering Project