用于视频预测的频率域 Transformer 网络
计算机视觉与模式识别
2019-03-04 v1 机器学习
摘要
视频预测任务是在给定若干先前帧的条件下预测后续帧。尽管近期取得诸多进展,该任务仍具挑战性,主要源于空间域中的高度非线性。为解决此问题,我们提出一种新颖架构——频率域 Transformer 网络(FDTN),这是一种端到端可学习模型,可估计并利用信号在频率域中的变换。实验评估表明,该方法可优于一些广泛使用的视频预测方法,如 Video Ladder Network(VLN)与 Predictive Gated Pyramids(PGP)。
引用
@article{arxiv.1903.00271,
title = {Frequency Domain Transformer Networks for Video Prediction},
author = {Hafez Farazi and Sven Behnke},
journal= {arXiv preprint arXiv:1903.00271},
year = {2019}
}
备注
Accepted for European Symposium on Artificial Neural Networks, Computational Intelligence and Machine Learning (ESANN), Bruges, Belgium, to appear April 2019