用于视频摘要的分层循环神经网络
计算机视觉与模式识别
2019-04-30 v1
摘要
利用视频帧或子镜头之间的时间依赖关系对于视频摘要任务非常重要。实际上,RNN 擅长时间依赖建模,并在许多基于视频的任务(如视频字幕与分类)中取得了压倒性性能。然而,RNN 不足以应对视频摘要任务,因为传统 RNN(包括 LSTM)只能处理短视频,而摘要任务中的视频通常时长更长。为解决该问题,我们提出一种用于视频摘要的分层循环神经网络,本文中称为 H-RNN。具体而言,它有两层,第一层用于编码从原始视频中切出的短视频子镜头,每个子镜头的最终隐藏状态被输入第二层以计算其作为关键子镜头的置信度。相比传统 RNN,H-RNN 更适用于视频摘要,因为它能利用帧间的长时间依赖,同时显著减少计算量。在包括 Combined 数据集和 VTW 数据集的两个流行数据集上的结果表明,所提 H-RNN 优于当前最优(state-of-the-art)方法。
引用
@article{arxiv.1904.12251,
title = {Hierarchical Recurrent Neural Network for Video Summarization},
author = {Bin Zhao and Xuelong Li and Xiaoqiang Lu},
journal= {arXiv preprint arXiv:1904.12251},
year = {2019}
}
备注
published by ACM Conference on MultiMedia