基于频域 Transformer 网络的运动分割
计算机视觉与模式识别
2020-04-21 v1
摘要
自监督预测是一种学习能够捕捉数据底层结构的表征的强大机制。尽管近期取得了进展,自监督视频预测任务仍然具有挑战性。使该任务困难的关键因素之一是运动分割,即分割各个物体与背景并分别估计其运动。在视频预测中,每个物体的形状、外观与变换应仅通过在像素空间中预测下一帧来理解。为应对该任务,我们提出了一种新颖的端到端可学习架构,其通过分别建模前景与背景来预测下一帧,同时使用频域 Transformer 网络(Frequency Domain Transformer Networks)估计并预测前景运动。实验评估表明,这产生了可解释的表征,并且我们的方法在合成数据上可以优于一些广泛使用的视频预测方法,如 Video Ladder Network 与 Predictive Gated Pyramids。
引用
@article{arxiv.2004.08638,
title = {Motion Segmentation using Frequency Domain Transformer Networks},
author = {Hafez Farazi and Sven Behnke},
journal= {arXiv preprint arXiv:2004.08638},
year = {2020}
}
备注
28th European Symposium on Artificial Neural Networks, Computational Intelligence and Machine Learning (ESANN), Bruges, Belgium, 2020