中文

Show and Tell:一种神经图像字幕生成器

计算机视觉与模式识别 2015-04-22 v2

摘要

自动描述图像内容是人工智能中的一个基本问题,它连接了计算机视觉和自然语言处理。在本文中,我们提出了一种基于深度循环架构的生成模型,该模型结合了计算机视觉和机器翻译的最新进展,可用于生成描述图像的自然句子。该模型的训练旨在最大化给定训练图像的目标描述句子的似然性。在多个数据集上的实验显示了该模型的准确性及其仅从图像描述中学习到的语言的流畅性。我们的模型通常非常准确,我们通过定性和定量方式进行了验证。例如,虽然当前 Pascal 数据集上的最先进 BLEU-1 分数(越高越好)为 25,但我们的方法达到了 59,而人类表现约为 69。我们还展示了在 Flickr30k 上 BLEU-1 分数从 56 提高到 66,在 SBU 上从 19 提高到 28。最后,在新发布的 COCO 数据集上,我们达到了 27.7 的 BLEU-4 分数,这是当前的最先进水平。

关键词

引用

@article{arxiv.1411.4555,
  title  = {Show and Tell: A Neural Image Caption Generator},
  author = {Oriol Vinyals and Alexander Toshev and Samy Bengio and Dumitru Erhan},
  journal= {arXiv preprint arXiv:1411.4555},
  year   = {2015}
}