中文

网络架构与训练方法对学习型视频帧预测性能的影响

计算机视觉与模式识别 2020-08-17 v1 图像与视频处理

摘要

我们分析了前馈与循环神经网络(RNN)架构及其相关训练方法在学习型帧预测中的性能。为此,我们使用均方损失训练了残差全卷积神经网络(FCNN)、卷积RNN(CRNN)和卷积长短期记忆(CLSTM)网络用于下一帧预测。我们对循环网络进行了无状态和有状态训练。实验结果表明,残差FCNN架构在峰值信噪比(PSNR)方面表现最佳,但代价是更高的训练和测试(推理)计算复杂度。CRNN可使用有状态截断时间反向传播过程稳定且高效地训练,并且它需要低一个数量级的推理运行时间,以可接受的性能实现近实时帧预测。

关键词

引用

@article{arxiv.2008.06106,
  title  = {Effect of Architectures and Training Methods on the Performance of Learned Video Frame Prediction},
  author = {M. Akin Yilmaz and A. Murat Tekalp},
  journal= {arXiv preprint arXiv:2008.06106},
  year   = {2020}
}

备注

Accepted for publication at IEEE ICIP 2019