Show and Tell:从 2015 年 MSCOCO 图像描述挑战赛中获得的经验
计算机视觉与模式识别
2016-09-22 v1
摘要
自动描述图像内容是人工智能中的一个基本问题,它连接了计算机视觉和自然语言处理。在本文中,我们提出了一种基于深度循环架构的生成模型,该模型结合了计算机视觉和机器翻译的最新进展,可用于生成描述图像的自然语句。该模型被训练以在给定训练图像的情况下最大化目标描述句子的似然性。在多个数据集上的实验表明了该模型的准确性以及它仅从图像描述中学习到的语言的流畅性。我们的模型通常相当准确,我们通过定性和定量两方面对此进行了验证。最后,鉴于最近对该任务的研究热潮,2015 年使用新发布的 COCO 数据集组织了一场比赛。我们描述并分析了应用于自身基线的各种改进,并展示了在比赛中的最终表现(我们与 Microsoft Research 的一个团队并列第一),并提供了 TensorFlow 中的开源实现。
引用
@article{arxiv.1609.06647,
title = {Show and Tell: Lessons learned from the 2015 MSCOCO Image Captioning Challenge},
author = {Oriol Vinyals and Alexander Toshev and Samy Bengio and Dumitru Erhan},
journal= {arXiv preprint arXiv:1609.06647},
year = {2016}
}
备注
arXiv admin note: substantial text overlap with arXiv:1411.4555