你在和机器说话吗?面向多语言图像问答的数据集与方法
计算机视觉与模式识别
2015-11-04 v3 计算与语言
机器学习
摘要
本文中,我们提出 mQA 模型,其能够回答关于图像内容的问题。答案可以是一个句子、短语或单个词。我们的模型包含四个组件:用于提取问题表示的长短期记忆网络(LSTM)、用于提取视觉表示的卷积神经网络(CNN)、用于存储答案中语言上下文的 LSTM,以及用于融合前三个组件信息并生成答案的融合组件。我们构建了自由风格多语言图像问答(FM-IQA)数据集来训练和评估我们的 mQA 模型。它包含超过 150,000 张图像和 310,000 个自由风格中文问答对及其英文翻译。我们的 mQA 模型在该数据集上生成答案的质量通过图灵测试由人类评判者评估。具体而言,我们将人类提供的答案与我们的模型提供的答案混合。人类评判者需要区分我们的模型与人类。他们还会给出一个分数(即 0、1、2,越大越好)来指示答案质量。我们提出了监控该评估过程质量的策略。实验表明,在 64.7% 的情况下,人类评判者无法将我们的模型与人类区分开。平均分为 1.454(人类为 1.918)。这项工作的细节,包括 FM-IQA 数据集,可在项目页面找到:http://idl.baidu.com/FM-IQA.html
引用
@article{arxiv.1505.05612,
title = {Are You Talking to a Machine? Dataset and Methods for Multilingual Image Question Answering},
author = {Haoyuan Gao and Junhua Mao and Jie Zhou and Zhiheng Huang and Lei Wang and Wei Xu},
journal= {arXiv preprint arXiv:1505.05612},
year = {2015}
}
备注
Dataset released on the project page, see http://idl.baidu.com/FM-IQA.html ; NIPS 2015 camera ready version