使用深度循环神经网络将视频翻译为自然语言
计算机视觉与模式识别
2015-05-01 v3 计算与语言
摘要
解决视觉符号接地问题一直是人工智能的目标。随着深度学习在静态图像自然语言接地方面的最新突破,该领域似乎正在接近这一目标。在本文中,我们提出使用统一的深度神经网络(同时具有卷积和循环结构)直接将视频翻译为句子。描述性视频数据集稀缺,大多数现有方法应用于词汇量较小的玩具领域。通过从120万+带有类别标签的图像和10万+带有标题的图像中迁移知识,我们的方法能够为具有大词汇量的开放域视频生成句子描述。我们使用语言生成指标、主语、动词和宾语预测准确性以及人工评估将我们的方法与近期工作进行比较。
引用
@article{arxiv.1412.4729,
title = {Translating Videos to Natural Language Using Deep Recurrent Neural Networks},
author = {Subhashini Venugopalan and Huijuan Xu and Jeff Donahue and Marcus Rohrbach and Raymond Mooney and Kate Saenko},
journal= {arXiv preprint arXiv:1412.4729},
year = {2015}
}
备注
NAACL-HLT 2015 camera ready