PreCNet:基于预测编码的下一帧视频预测
计算机视觉与模式识别
2023-02-09 v3 机器学习
神经与进化计算
摘要
预测编码目前是神经科学中极具影响力的理论,但尚未在机器学习中被广泛采用。本工作中,我们将Rao和Ballard(1999)的开创性模型转化为现代深度学习框架,同时最大程度忠实于原始架构。所提出的网络(PreCNet)在一个广泛使用的下一帧视频预测基准上进行了测试,该基准由车载摄像头记录的城市场景图像组成,并取得了最先进的性能。当使用更大的训练集(来自BDD100k的2M图像)时,所有指标(MSE、PSNR、SSIM)性能进一步提升,这指出了KITTI训练集的局限性。本工作表明,一个精心基于神经科学模型、且未针对特定任务显式定制的架构,可以展现出卓越性能。
引用
@article{arxiv.2004.14878,
title = {PreCNet: Next-Frame Video Prediction Based on Predictive Coding},
author = {Zdenek Straka and Tomas Svoboda and Matej Hoffmann},
journal= {arXiv preprint arXiv:2004.14878},
year = {2023}
}
备注
Accepted by IEEE Transactions on Neural Networks and Learning Systems (TNNLS)