中文

Taylor留待后用:基于Taylor表示的视频预测解耦方法

计算机视觉与模式识别 2021-05-25 v1 机器学习

摘要

视频预测是一项具有挑战性的任务,在气象和机器人系统中有着广泛的应用前景。现有工作未能在短期与长期预测性能之间取得权衡,也未能从视频帧中提取鲁棒的潜在动力学规律。我们提出了一种双分支序列到序列深度模型,通过新颖的循环预测模块(TaylorCell)与残差模块,解耦视频帧中的Taylor特征与残差特征。TaylorCell可将视频帧的高维特征展开为有限Taylor级数以描述潜在规律。在TaylorCell中,我们提出了Taylor预测单元(TPU)与记忆校正单元(MCU)。TPU利用首帧的导数信息预测未来帧,避免误差累积。MCU蒸馏所有过去帧的信息以校正来自TPU的预测Taylor特征。相应地,残差模块提取与Taylor特征互补的残差特征。在三个通用数据集(Moving MNIST、TaxiBJ、Human 3.6)上,我们的模型优于或达到了state-of-the-art模型,且消融实验证明了我们的模型在长期预测中的有效性。

关键词

引用

@article{arxiv.2105.11062,
  title  = {Taylor saves for later: disentanglement for video prediction using Taylor representation},
  author = {Ting Pan and Zhuqing Jiang and Jianan Han and Shiping Wen and Aidong Men and Haiying Wang},
  journal= {arXiv preprint arXiv:2105.11062},
  year   = {2021}
}