神经自语:通过连续提问与回答的图像理解
计算机视觉与模式识别
2015-12-14 v1 计算与语言
机器人学
摘要
在本文中,我们考虑通过主动提出基于图像的问题并随后回答所提出的问题来持续发现图像内容的问题。关键组件包括视觉问题生成(VQG)模块和视觉问答(VQA)模块,其中使用了循环神经网络(RNN)和卷积神经网络(CNN)。给定包含图像、问题及其答案的数据集,两个模块同时训练,不同之处在于 VQG 使用图像作为输入、相应问题作为输出,而 VQA 使用图像和问题作为输入、相应答案作为输出。我们使用 Amazon Mechanical Turk 主观评估自语过程,显示了所提方法的有效性。
引用
@article{arxiv.1512.03460,
title = {Neural Self Talk: Image Understanding via Continuous Questioning and Answering},
author = {Yezhou Yang and Yi Li and Cornelia Fermuller and Yiannis Aloimonos},
journal= {arXiv preprint arXiv:1512.03460},
year = {2015}
}