中文

可玩视频生成

计算机视觉与模式识别 2021-01-29 v1 人工智能

摘要

本文引入可玩视频生成(PVG, playable video generation)这一无监督学习问题。在 PVG 中,我们的目标是允许用户像玩视频游戏一样,在每个时间步选择一个离散动作来控制生成的视频。该任务的难点既在于学习语义一致的动作,也在于根据用户输出生生成逼真的视频。我们提出一种新颖的 PVG 框架,该框架在大规模无标签视频数据集上以自监督方式训练。我们采用预测动作标签作为瓶颈的编码器-解码器架构。网络以生成视频上的重建损失作为主要驱动损失,被约束去学习丰富的动作空间。我们在具有广泛环境多样性的多个数据集上展示了所提方法的有效性。更多细节、代码与示例见项目页 willi-menapace.github.io/playable-video-generation-website。

关键词

引用

@article{arxiv.2101.12195,
  title  = {Playable Video Generation},
  author = {Willi Menapace and Stéphane Lathuilière and Sergey Tulyakov and Aliaksandr Siarohin and Elisa Ricci},
  journal= {arXiv preprint arXiv:2101.12195},
  year   = {2021}
}