中文

基于视频的自监督等变场景合成

计算机视觉与模式识别 2021-02-02 v1

摘要

我们提出一种自监督框架,从视频中学习场景表示,并自动将其划分为背景、角色及其动画。我们的方法利用移动角色相对于其在帧间变换的等变性,以及背景相对于同一变换的恒常性。训练后,我们可以实时操纵图像编码以创建所述划分组件的新颖组合。据我们所知,我们是首个执行无监督的可解释背景、角色与动画提取及合成的方法。我们在三个数据集上展示了结果:带背景的 Moving MNIST、2D 视频游戏精灵与时尚建模(Fashion Modeling)。

关键词

引用

@article{arxiv.2102.00863,
  title  = {Self-Supervised Equivariant Scene Synthesis from Video},
  author = {Cinjon Resnick and Or Litany and Cosmas Heiß and Hugo Larochelle and Joan Bruna and Kyunghyun Cho},
  journal= {arXiv preprint arXiv:2102.00863},
  year   = {2021}
}

备注

arXiv admin note: text overlap with arXiv:2011.05787