通过估计三维动态场景结构从单帧进行无监督视频预测
计算机视觉与模式识别
2021-06-18 v1 人工智能
机器学习
摘要
我们这项工作的目标是仅给定一初始帧作为输入来生成逼真视频。现有的无监督方法未考虑视频通常展示三维环境这一事实,且该环境应随相机和物体运动在帧间保持连贯。我们通过开发一个模型来解决此问题,该模型首先估计场景的潜在三维结构,包括任何运动物体的分割。然后它通过模拟物体和相机动力学并渲染所得视图来预测未来帧。重要的是,它仅使用预测未来帧的无监督目标进行端到端训练,无需任何三维信息或分割标注。在两个具有挑战性的自然视频数据集上的实验表明,我们的模型能从单帧估计三维结构和运动分割,从而生成合理且多样的预测。
引用
@article{arxiv.2106.09051,
title = {Unsupervised Video Prediction from a Single Frame by Estimating 3D Dynamic Scene Structure},
author = {Paul Henderson and Christoph H. Lampert and Bernd Bickel},
journal= {arXiv preprint arXiv:2106.09051},
year = {2021}
}