基于CNN的帧级镜头重要性预测用于视频摘要
计算机视觉与模式识别
2017-08-24 v1
摘要
在互联网上,冗余、未编辑的原始视频无处不在,使得视频摘要成为一个重要问题。传统的视频摘要方法采用启发式的一组手工特征,在许多情况下无法捕捉场景的细微抽象。本文提出了一种深度学习方法,将视频的上下文映射至类似于人类感知的场景重要性。具体地,提出了一种基于卷积神经网络(CNN)的架构来模拟面向用户的视频摘要的帧级镜头重要性。CNN的权重和偏置通过离线处理进行充分训练,从而能几乎瞬时地提供未见视频帧的重要性。使用公开数据库TVSum50进行了镜头重要性估计实验。结果表明,在所提出的网络在平均绝对误差、绝对误差方差和相对F度量方面,性能显著优于常用的基于特征的方法用于估计镜头重要性。
引用
@article{arxiv.1708.07023,
title = {CNN-Based Prediction of Frame-Level Shot Importance for Video Summarization},
author = {Mohaiminul Al Nahian and A. S. M. Iftekhar and Mohammad Tariqul Islam and S. M. Mahbubur Rahman and Dimitrios Hatzinakos},
journal= {arXiv preprint arXiv:1708.07023},
year = {2017}
}
备注
Accepted in International Conference on new Trends in Computer Sciences (ICTCS), Amman-Jordan, 2017