面向视觉序列任务的深度循环神经网络框架
计算机视觉与模式识别
2019-10-28 v4
摘要
高效提取时序与表征特征在理解视觉序列信息中起着关键作用。为此,我们提出了一种可有效堆叠深度的新型循环神经框架。我们的深度 RNN 框架主要有两项新颖设计:其一为一种称为上下文桥接模块(Context Bridge Module, CBM)的新型 RNN 模块,它将沿序列(时间方向)与沿深度(空间表征方向)流动的信息分离,通过在构建深度时平衡这两个方向,使训练更加容易;其二是重叠一致性训练方案(Overlap Coherence Training Scheme),鉴于计算资源的限制,该方案降低了长视觉序列任务的训练复杂度。我们提供了经验证据,表明我们的深度 RNN 框架易于优化,并能在多个视觉序列问题上从增加的深度中获得精度提升。在这些任务上,我们使用 15 层评估了深度 RNN 框架,是传统 RNN 网络的 7 倍,但仍易于训练。我们的深度框架在 Kinetics、UCF-101 和 HMDB-51 的视频分类上比较浅层 RNN 模型取得了超过 11% 的相对提升。对于辅助标注,在将 Polygon-RNN 的浅层 RNN 部分替换为我们的 15 层深度 CBM 后,性能提升了 14.7%。对于视频未来预测,我们的深度 RNN 在 PSNR 和 SSIM 上比最先进的浅层模型性能提升了 2.4%。本文随附发布了代码与训练好的模型:https://github.com/BoPang1996/Deep-RNN-Framework。
引用
@article{arxiv.1811.09961,
title = {Deep RNN Framework for Visual Sequential Applications},
author = {Bo Pang and Kaiwen Zha and Hanwen Cao and Chen Shi and Cewu Lu},
journal= {arXiv preprint arXiv:1811.09961},
year = {2019}
}
备注
10 pages, 7 figures, CVPR 2019