中文

用于视频预测的频率域 Transformer 网络

计算机视觉与模式识别 2019-03-04 v1 机器学习

摘要

视频预测任务是在给定若干先前帧的条件下预测后续帧。尽管近期取得诸多进展,该任务仍具挑战性,主要源于空间域中的高度非线性。为解决此问题,我们提出一种新颖架构——频率域 Transformer 网络(FDTN),这是一种端到端可学习模型,可估计并利用信号在频率域中的变换。实验评估表明,该方法可优于一些广泛使用的视频预测方法,如 Video Ladder Network(VLN)与 Predictive Gated Pyramids(PGP)。

关键词

引用

@article{arxiv.1903.00271,
  title  = {Frequency Domain Transformer Networks for Video Prediction},
  author = {Hafez Farazi and Sven Behnke},
  journal= {arXiv preprint arXiv:1903.00271},
  year   = {2019}
}

备注

Accepted for European Symposium on Artificial Neural Networks, Computational Intelligence and Machine Learning (ESANN), Bruges, Belgium, to appear April 2019