中文

开放式视觉问答

计算与语言 2016-10-11 v1 计算机视觉与模式识别 多媒体

摘要

本论文报告研究了在深度学习框架下解决视觉问答(VQA)任务的方法。作为初步步骤,我们探索了用于自然语言处理(NLP)中处理问答(基于文本)的长短期记忆(LSTM)网络。随后,我们修改了先前的模型,使其除了问题之外还能接受图像作为输入。为此,我们探索了 VGG-16 和 K-CNN 卷积神经网络来从图像中提取视觉特征。这些特征与问题的词嵌入或句子嵌入融合以预测答案。这项工作成功提交至 2016 年视觉问答挑战赛,在测试数据集上取得了 53.62% 的准确率。所开发的软件遵循了最佳编程实践和 Python 代码风格,为 Keras 中的不同配置提供了一致的基线。

关键词

引用

@article{arxiv.1610.02692,
  title  = {Open-Ended Visual Question-Answering},
  author = {Issey Masuda and Santiago Pascual de la Puente and Xavier Giro-i-Nieto},
  journal= {arXiv preprint arXiv:1610.02692},
  year   = {2016}
}

备注

Bachelor thesis report graded with A with honours at ETSETB Telecom BCN school, Universitat Polit\`ecnica de Catalunya (UPC). June 2016. Source code and models are publicly available at http://imatge-upc.github.io/vqa-2016-cvprw/