注意力上的注意力:用于视觉问答(VQA)的架构
计算与语言
2018-03-22 v1 人工智能
计算机视觉与模式识别
摘要
视觉问答(VQA)是深度学习研究中日益热门的主题,需要将自然语言处理和计算机视觉模块协调到一个单一架构中。我们在 VQA Challenge 中获得第一名的模型基础上,开发了十三种新的注意力机制并引入了一个简化的分类器。我们进行了 300 GPU 小时的广泛超参数和架构搜索,实现了 64.78% 的评估得分,超越了现有 SOTA 单模型 63.15% 的验证得分。
引用
@article{arxiv.1803.07724,
title = {Attention on Attention: Architectures for Visual Question Answering (VQA)},
author = {Jasdeep Singh and Vincent Ying and Alex Nutkiewicz},
journal= {arXiv preprint arXiv:1803.07724},
year = {2018}
}
备注
Visual Question Answering Project