用于视频表示及描述生成应用的分层循环神经编码器
计算机视觉与模式识别
2015-11-12 v1
摘要
近来,深度学习方法,尤其是深度卷积神经网络(ConvNets),在图像分类中以快速处理速度取得了压倒性准确率。将时间结构与深度ConvNets结合用于视频表示成为视频内容分析的基本问题。本文中,我们提出一种新方法,即分层循环神经编码器(HRNE),以利用视频的时间信息。与近期视频表示推断方法相比,本文作出以下三点贡献。首先,我们的HRNE能够通过缩短输入信息流的长度并在更高层次组合多个连续输入,从而在更长范围内高效利用视频时间结构。其次,计算操作显著减少的同时获得了更多非线性。第三,HRNE能够揭示不同粒度帧块之间的时间转移,即它既能建模帧间的时间转移,也能建模段间转移。我们将新方法应用于视频描述生成(video captioning),其中时间信息起关键作用。实验表明我们的方法在视频描述生成基准上优于当前最优(state-of-the-art)。值得注意的是,即使仅使用单一网络并以仅含RGB流作为输入,HRNE也击败了所有结合多输入的近期系统,例如RGB ConvNet加3D ConvNet。
引用
@article{arxiv.1511.03476,
title = {Hierarchical Recurrent Neural Encoder for Video Representation with Application to Captioning},
author = {Pingbo Pan and Zhongwen Xu and Yi Yang and Fei Wu and Yueting Zhuang},
journal= {arXiv preprint arXiv:1511.03476},
year = {2015}
}