用于视觉问答的分层问题-图像协同注意力
计算机视觉与模式识别
2017-01-20 v5 计算与语言
摘要
近期许多工作提出了用于视觉问答(VQA)的注意力模型,这些模型生成突出与回答问题相关图像区域的空间图。在本文中,我们认为除了建模“看哪里”或视觉注意力之外,建模“听哪些词”或问题注意力同样重要。我们提出了一种用于 VQA 的新型协同注意力模型,联合推理图像与问题注意力。此外,我们的模型通过一种新颖的一维卷积神经网络(CNN)以分层方式推理问题(并由此通过协同注意力机制推理图像)。我们的模型在 VQA 数据集上将最优性能从 60.3% 提升至 60.5%,在 COCO-QA 数据集上从 61.6% 提升至 63.3%。通过使用 ResNet,性能进一步提升至 VQA 的 62.1% 与 COCO-QA 的 65.4%。
引用
@article{arxiv.1606.00061,
title = {Hierarchical Question-Image Co-Attention for Visual Question Answering},
author = {Jiasen Lu and Jianwei Yang and Dhruv Batra and Devi Parikh},
journal= {arXiv preprint arXiv:1606.00061},
year = {2017}
}
备注
11 pages, 7 figures, 3 tables in 2016 Conference on Neural Information Processing Systems (NIPS)