中文

基于CNN的帧级镜头重要性预测用于视频摘要

计算机视觉与模式识别 2017-08-24 v1

摘要

在互联网上,冗余、未编辑的原始视频无处不在,使得视频摘要成为一个重要问题。传统的视频摘要方法采用启发式的一组手工特征,在许多情况下无法捕捉场景的细微抽象。本文提出了一种深度学习方法,将视频的上下文映射至类似于人类感知的场景重要性。具体地,提出了一种基于卷积神经网络(CNN)的架构来模拟面向用户的视频摘要的帧级镜头重要性。CNN的权重和偏置通过离线处理进行充分训练,从而能几乎瞬时地提供未见视频帧的重要性。使用公开数据库TVSum50进行了镜头重要性估计实验。结果表明,在所提出的网络在平均绝对误差、绝对误差方差和相对F度量方面,性能显著优于常用的基于特征的方法用于估计镜头重要性。

关键词

引用

@article{arxiv.1708.07023,
  title  = {CNN-Based Prediction of Frame-Level Shot Importance for Video Summarization},
  author = {Mohaiminul Al Nahian and A. S. M. Iftekhar and Mohammad Tariqul Islam and S. M. Mahbubur Rahman and Dimitrios Hatzinakos},
  journal= {arXiv preprint arXiv:1708.07023},
  year   = {2017}
}

备注

Accepted in International Conference on new Trends in Computer Sciences (ICTCS), Amman-Jordan, 2017