中文

基于长短期记忆网络的视频摘要

计算机视觉与模式识别 2016-08-01 v2 机器学习

摘要

我们提出一种新颖的监督学习技术,通过自动选择关键帧或关键子镜头来生成视频摘要。将该问题视为序列数据上的结构化预测问题,我们的主要思想是使用长短期记忆(Long Short-Term Memory, LSTM)——一种特殊的循环神经网络——来建模视频摘要任务中所蕴含的可变范围依赖关系。我们的学习模型在两个基准视频数据集上达到了最先进的(state-of-the-art)结果。详细分析证明了模型设计的合理性。特别地,我们表明考虑视频中的序列结构并对其进行建模是至关重要的。除了建模技术上的进展,我们引入了技术来解决训练复杂学习模型所需大量标注数据的问题。在那里,我们的主要思想是利用存在的辅助标注视频数据集,尽管它们在视觉风格和内容上是异构的。具体地,我们展示域适应(domain adaptation)技术可以通过减少这些数据集之间统计特性的差异来改进摘要。

关键词

引用

@article{arxiv.1605.08110,
  title  = {Video Summarization with Long Short-term Memory},
  author = {Ke Zhang and Wei-Lun Chao and Fei Sha and Kristen Grauman},
  journal= {arXiv preprint arXiv:1605.08110},
  year   = {2016}
}

备注

To appear in ECCV 2016