中文

序列到序列——视频到文本

计算机视觉与模式识别 2015-10-20 v3

摘要

真实世界视频通常具有复杂动态;生成开放域视频描述的方法应当对时间结构敏感,并允许可变长度的输入(帧序列)与输出(词序列)。为处理该问题,我们提出一种新颖的端到端序列到序列模型来生成视频字幕。为此,我们利用循环神经网络,特别是 LSTMs,其已在图像字幕生成中展现出最先进的性能。我们的 LSTM 模型在视频-句子对上训练,并学习将视频帧序列与词序列相关联,以生成视频剪辑中事件的描述。我们的模型自然能够学习帧序列的时间结构以及所生成句子的序列模型,即语言模型。我们在标准 YouTube 视频集与两个电影描述数据集(M-VAD 和 MPII-MD)上评估了利用不同视觉特征的若干模型变体。

关键词

引用

@article{arxiv.1505.00487,
  title  = {Sequence to Sequence -- Video to Text},
  author = {Subhashini Venugopalan and Marcus Rohrbach and Jeff Donahue and Raymond Mooney and Trevor Darrell and Kate Saenko},
  journal= {arXiv preprint arXiv:1505.00487},
  year   = {2015}
}

备注

ICCV 2015 camera-ready. Includes code, project page and LSMDC challenge results