基于深度学习的图像问答教程
计算机视觉与模式识别
2016-10-05 v1 人工智能
计算与语言
机器学习
神经与进化计算
摘要
随着计算机视觉和自然语言理解中更精确方法的发展,能够回答关于真实世界图像内容问题的整体架构已经出现。在本教程中,我们构建了一种基于神经的方法来回答关于图像的问题。我们的教程基于两个数据集:(主要基于)DAQUAR,以及(少量基于)VQA。通过微小的调整,我们在此提出的模型可以在两个数据集上取得具有竞争力的性能,事实上,它们是将 LSTM 与图像的全局完整帧 CNN 表示相结合的最佳方法之一。我们希望读者在阅读本教程后,能够使用深度学习框架(如 Keras 和引入的 Kraino)构建各种架构,从而在这一具有挑战性的任务上进一步提升性能。
引用
@article{arxiv.1610.01076,
title = {Tutorial on Answering Questions about Images with Deep Learning},
author = {Mateusz Malinowski and Mario Fritz},
journal= {arXiv preprint arXiv:1610.01076},
year = {2016}
}
备注
The tutorial was presented at '2nd Summer School on Integrating Vision and Language: Deep Learning' in Malta, 2016