基于分层循环神经网络的视频段落描述生成
计算机视觉与模式识别
2016-04-07 v2
摘要
我们提出一种利用分层循环神经网络(RNNs)来解决视频描述问题的方法,即生成一句或多句句子来描述一段真实视频。我们的分层框架包含一个句子生成器和一个段落生成器。句子生成器产生一句简单的短句来描述特定的短视频区间。它利用时间和空间注意力机制在生成过程中选择性地聚焦于视觉元素。段落生成器通过输入句子生成器产生的句子嵌入,将其与段落历史结合,并输出句子生成器的新初始状态,从而捕捉句间依赖关系。我们在两个大规模基准数据集YouTubeClips和TACoS-MultiLevel上评估了我们的方法。实验表明,我们的方法以BLEU@4分数分别达到0.499和0.305显著优于当前最先进的方法。
引用
@article{arxiv.1510.07712,
title = {Video Paragraph Captioning Using Hierarchical Recurrent Neural Networks},
author = {Haonan Yu and Jiang Wang and Zhiheng Huang and Yi Yang and Wei Xu},
journal= {arXiv preprint arXiv:1510.07712},
year = {2016}
}
备注
In CVPR2016