中文

基于解耦特征的互抑制网络用于视频预测

计算机视觉与模式识别 2019-07-16 v2

摘要

视频预测被认为是一个困难问题,因为视频不仅包含高维空间信息,还包含复杂时间信息。视频预测可通过在近期帧中寻找特征,并利用它们生成未来帧的近似。我们通过对视频中空间与时间特征解耦来处理该问题。我们引入以对抗方式训练的互抑制网络(MSnet),其产生不含运动信息的空间特征,以及不含空间信息的运动特征。MSnet 随后在基于编码器-解码器的架构中使用运动引导连接,将前一帧的空间特征变换至未来帧时刻。我们展示 MSnet 如何利用解耦表示进行视频预测。我们还通过实验评估该方法解耦特征的有效性。尽管 MSnet 具有更简单的编码器,其效果仍优于其他近期视频预测方法。

关键词

引用

@article{arxiv.1804.04810,
  title  = {Mutual Suppression Network for Video Prediction using Disentangled Features},
  author = {Jungbeom Lee and Jangho Lee and Sungmin Lee and Sungroh Yoon},
  journal= {arXiv preprint arXiv:1804.04810},
  year   = {2019}
}

备注

BMVC 2019 (Oral)