中文

基于深度学习的图像问答教程

计算机视觉与模式识别 2016-10-05 v1 人工智能 计算与语言 机器学习 神经与进化计算

摘要

随着计算机视觉和自然语言理解中更精确方法的发展,能够回答关于真实世界图像内容问题的整体架构已经出现。在本教程中,我们构建了一种基于神经的方法来回答关于图像的问题。我们的教程基于两个数据集:(主要基于)DAQUAR,以及(少量基于)VQA。通过微小的调整,我们在此提出的模型可以在两个数据集上取得具有竞争力的性能,事实上,它们是将 LSTM 与图像的全局完整帧 CNN 表示相结合的最佳方法之一。我们希望读者在阅读本教程后,能够使用深度学习框架(如 Keras 和引入的 Kraino)构建各种架构,从而在这一具有挑战性的任务上进一步提升性能。

关键词

引用

@article{arxiv.1610.01076,
  title  = {Tutorial on Answering Questions about Images with Deep Learning},
  author = {Mateusz Malinowski and Mario Fritz},
  journal= {arXiv preprint arXiv:1610.01076},
  year   = {2016}
}

备注

The tutorial was presented at '2nd Summer School on Integrating Vision and Language: Deep Learning' in Malta, 2016