神经图像字幕中的图像表示与新领域
计算与语言
2015-08-11 v1 计算机视觉与模式识别
摘要
我们考察了近期自动字幕生成中令人鼓舞的结果主要归因于语言模型的可能性。通过改变卷积神经网络产生的图像表示质量,我们发现最先进的神经字幕算法即使提供令人惊讶地差的图像表示,也能生成高质量字幕。我们在一个新的、细粒度的、迁移学习的字幕领域复现了该结果,该领域由66K食谱图像/标题对组成。我们还提供了一些关于自动字幕数据集适用性的实验,发现每幅图像有多个字幕是有益的,但并非绝对要求。
引用
@article{arxiv.1508.02091,
title = {Image Representations and New Domains in Neural Image Captioning},
author = {Jack Hessel and Nicolas Savva and Michael J. Wilber},
journal= {arXiv preprint arXiv:1508.02091},
year = {2015}
}
备注
11 Pages, 5 Images, To appear at EMNLP 2015's Vision + Learning workshop