TaylorSwiftNet:基于泰勒展开的时间建模用于快速未来帧预测
计算机视觉与模式识别
2022-10-13 v2
摘要
尽管循环神经网络(RNNs)在未来视频帧预测中展现出卓越能力,但它们在离散时间空间中建模动态,即以固定时间步顺序预测帧。因此,随着未来帧数量增加,RNNs 容易累积误差。相比之下,偏微分方程(PDEs)在连续时间空间中建模诸如动态之类的物理现象。然而,用于帧预测的估计 PDE 需要数值求解,这通过 PDE 的离散化完成,并削弱了相较于离散模型的大部分优势。因此,在本工作中,我们提出使用泰勒级数将视频中的运动近似为连续函数。为此,我们引入 TaylorSwiftNet,一种新颖的卷积神经网络,它学习估计给定输入视频的泰勒级数高阶项。TaylorSwiftNet 可以快速并行预测未来帧,并允许按需改变预测帧的时间分辨率。在各种数据集上的实验结果证明了我们模型的优越性。
引用
@article{arxiv.2110.14392,
title = {TaylorSwiftNet: Taylor Driven Temporal Modeling for Swift Future Frame Prediction},
author = {Saber Pourheydari and Emad Bahrami and Mohsen Fayyaz and Gianpiero Francesca and Mehdi Noroozi and Juergen Gall},
journal= {arXiv preprint arXiv:2110.14392},
year = {2022}
}
备注
BMVC 2022