Taylor留待后用:基于Taylor表示的视频预测解耦方法
计算机视觉与模式识别
2021-05-25 v1 机器学习
摘要
视频预测是一项具有挑战性的任务,在气象和机器人系统中有着广泛的应用前景。现有工作未能在短期与长期预测性能之间取得权衡,也未能从视频帧中提取鲁棒的潜在动力学规律。我们提出了一种双分支序列到序列深度模型,通过新颖的循环预测模块(TaylorCell)与残差模块,解耦视频帧中的Taylor特征与残差特征。TaylorCell可将视频帧的高维特征展开为有限Taylor级数以描述潜在规律。在TaylorCell中,我们提出了Taylor预测单元(TPU)与记忆校正单元(MCU)。TPU利用首帧的导数信息预测未来帧,避免误差累积。MCU蒸馏所有过去帧的信息以校正来自TPU的预测Taylor特征。相应地,残差模块提取与Taylor特征互补的残差特征。在三个通用数据集(Moving MNIST、TaxiBJ、Human 3.6)上,我们的模型优于或达到了state-of-the-art模型,且消融实验证明了我们的模型在长期预测中的有效性。
引用
@article{arxiv.2105.11062,
title = {Taylor saves for later: disentanglement for video prediction using Taylor representation},
author = {Ting Pan and Zhuqing Jiang and Jianan Han and Shiping Wen and Aidong Men and Haiying Wang},
journal= {arXiv preprint arXiv:2105.11062},
year = {2021}
}