用于图像描述的语言模型:怪癖与有效方法
计算与语言
2015-10-16 v3 人工智能
计算机视觉与模式识别
机器学习
摘要
两种近期的方法在图像描述(image captioning)中取得了最先进(state-of-the-art, SOTA)的结果。第一种使用流水线过程:由在图像上训练的卷积神经网络(CNN)生成一组候选词,然后使用最大熵(ME)语言模型将这些词排列成连贯句子。第二种使用CNN的倒数第二激活层作为循环神经网络(RNN)的输入,随后生成描述序列。本文中,我们首次通过使用相同的先进CNN作为输入,比较了这些不同语言建模方法的优劣。我们考察了不同方法中的问题,包括语言不规则性、描述重复和数据集重叠。通过结合ME与RNN方法的关键方面,我们在基准COCO数据集上取得了超越先前发表结果的新纪录性能。然而,我们在BLEU上看到的提升并未转化为人类判断。
引用
@article{arxiv.1505.01809,
title = {Language Models for Image Captioning: The Quirks and What Works},
author = {Jacob Devlin and Hao Cheng and Hao Fang and Saurabh Gupta and Li Deng and Xiaodong He and Geoffrey Zweig and Margaret Mitchell},
journal= {arXiv preprint arXiv:1505.01809},
year = {2015}
}
备注
See http://research.microsoft.com/en-us/projects/image_captioning for project information