中文

基于帧级与视频级特征及视觉内容分类的循环网络视频字幕生成

计算机视觉与模式识别 2015-12-10 v1

摘要

本文描述了一种利用循环神经网络(RNN)生成短视频片段文本描述的系统,我们在参与ICCV 2015中的2015大规模电影描述挑战赛(Large Scale Movie Description Challenge 2015)时使用了该系统。我们的工作构建于带有基于RNN语言模型的静态图像字幕生成系统之上,并利用静态图像特征与视频特定特征将该框架扩展到视频。此外,我们研究了视觉内容分类器作为字幕生成附加信息来源的用处。实验结果表明,联合利用基于关键帧的特征、密集轨迹视频特征和内容分类器输出比单独使用其中任一特征都具有更好的性能。

关键词

引用

@article{arxiv.1512.02949,
  title  = {Video captioning with recurrent networks based on frame- and video-level features and visual content classification},
  author = {Rakshith Shetty and Jorma Laaksonen},
  journal= {arXiv preprint arXiv:1512.02949},
  year   = {2015}
}