中文

PreCNet:基于预测编码的下一帧视频预测

计算机视觉与模式识别 2023-02-09 v3 机器学习 神经与进化计算

摘要

预测编码目前是神经科学中极具影响力的理论,但尚未在机器学习中被广泛采用。本工作中,我们将Rao和Ballard(1999)的开创性模型转化为现代深度学习框架,同时最大程度忠实于原始架构。所提出的网络(PreCNet)在一个广泛使用的下一帧视频预测基准上进行了测试,该基准由车载摄像头记录的城市场景图像组成,并取得了最先进的性能。当使用更大的训练集(来自BDD100k的2M图像)时,所有指标(MSE、PSNR、SSIM)性能进一步提升,这指出了KITTI训练集的局限性。本工作表明,一个精心基于神经科学模型、且未针对特定任务显式定制的架构,可以展现出卓越性能。

关键词

引用

@article{arxiv.2004.14878,
  title  = {PreCNet: Next-Frame Video Prediction Based on Predictive Coding},
  author = {Zdenek Straka and Tomas Svoboda and Matej Hoffmann},
  journal= {arXiv preprint arXiv:2004.14878},
  year   = {2023}
}

备注

Accepted by IEEE Transactions on Neural Networks and Learning Systems (TNNLS)