中文

生成关于图像的自然问题

计算与语言 2016-06-10 v3 人工智能 计算机视觉与模式识别

摘要

过去几年中,视觉与语言领域的工作呈爆发式增长,从图像描述到视频转写,以及回答关于图像的问题。这些任务聚焦于图像的字面描述。为了超越字面,我们选择探索关于图像的问题通常如何指向常识推理以及图像中物体所引发的抽象事件。在本文中,我们引入了视觉问题生成(Visual Question Generation, VQG)这一新任务,其要求系统在看到图像时提出自然且引人入胜的问题。我们提供了三个数据集,涵盖从以物体为中心到以事件为中心的各种图像,其抽象训练数据远比迄今为止最先进的图像描述系统所提供的更为丰富。我们训练并测试了若干生成式和检索式模型以应对VQG任务。评估结果表明,尽管此类模型能为多种图像提出合理的问题,但与人类表现之间仍存在较大差距,这激励了进一步将图像与常识知识和语用学相联系的工作。我们提出的任务为社区提供了新的挑战,我们希望其能增进探索视觉与语言间更深层次连接的兴趣。

关键词

引用

@article{arxiv.1603.06059,
  title  = {Generating Natural Questions About an Image},
  author = {Nasrin Mostafazadeh and Ishan Misra and Jacob Devlin and Margaret Mitchell and Xiaodong He and Lucy Vanderwende},
  journal= {arXiv preprint arXiv:1603.06059},
  year   = {2016}
}

备注

Proceedings of the 54th Annual Meeting of the Association for Computational Linguistics