中文

用于视频预测的局部频域 Transformer 网络

计算机视觉与模式识别 2021-05-12 v1 机器学习

摘要

视频预测通常指在给定若干过去帧的条件下预测视频序列的未来帧。由于视觉场景依据复杂的潜在动态演化(如相机的自我中心运动或所观测各独立物体的不同运动性),该领域仍具挑战性。这些动态大多对观测者隐藏,并表现为连续视频帧之间常高度非线性的变换。因此,视频预测不仅关乎预期真实世界中的视觉变化,更主要地已成为一种针对所观测环境之形成与动态的无监督学习准则。许多基于深度学习的视频预测前沿模型在其核心使用了某种形式的循环层,如长短期记忆(LSTM)或门控循环单元(GRU)。尽管这些模型能预测未来帧,它们完全依赖这些循环结构同时执行三项不同任务:提取变换、将其投影至未来、以及变换当前帧。为完全解释所形成的内部表征,厘清这些任务至关重要。本文提出一个完全可微的构建模块,可分别执行所有这些任务并保持可解释性。我们推导了相关理论基础,并展示了在合成与真实数据上的结果。我们证明所提方法可便捷扩展以执行运动分割并解释场景构成,且通过仅观测无标签视频数据,以完全可解释的方式学习生成可靠预测。

关键词

引用

@article{arxiv.2105.04637,
  title  = {Local Frequency Domain Transformer Networks for Video Prediction},
  author = {Hafez Farazi and Jan Nogga and Sven Behnke},
  journal= {arXiv preprint arXiv:2105.04637},
  year   = {2021}
}