中文

通过估计三维动态场景结构从单帧进行无监督视频预测

计算机视觉与模式识别 2021-06-18 v1 人工智能 机器学习

摘要

我们这项工作的目标是仅给定一初始帧作为输入来生成逼真视频。现有的无监督方法未考虑视频通常展示三维环境这一事实,且该环境应随相机和物体运动在帧间保持连贯。我们通过开发一个模型来解决此问题,该模型首先估计场景的潜在三维结构,包括任何运动物体的分割。然后它通过模拟物体和相机动力学并渲染所得视图来预测未来帧。重要的是,它仅使用预测未来帧的无监督目标进行端到端训练,无需任何三维信息或分割标注。在两个具有挑战性的自然视频数据集上的实验表明,我们的模型能从单帧估计三维结构和运动分割,从而生成合理且多样的预测。

关键词

引用

@article{arxiv.2106.09051,
  title  = {Unsupervised Video Prediction from a Single Frame by Estimating 3D Dynamic Scene Structure},
  author = {Paul Henderson and Christoph H. Lampert and Bernd Bickel},
  journal= {arXiv preprint arXiv:2106.09051},
  year   = {2021}
}