中文

基于单图像自监督扩散学习三维摄影视频

计算机视觉与模式识别 2023-02-22 v1

摘要

三维摄影将静态图像渲染为具有吸引人的三维视觉效果的视频。现有方法通常先进行单目深度估计,然后将输入帧以各种视点渲染至后续帧,最后使用修复模型填补那些缺失/被遮挡的区域。修复模型在渲染质量中起着关键作用,但它通常在域外数据上训练。为缩小训练与推理的差距,我们提出一种新颖的自监督扩散模型作为修复模块。给定单张输入图像,我们通过随机循环渲染自动构建被遮挡掩码图像与真实图像的训练对。所构建的训练样本与测试实例紧密对齐,无需数据标注。为充分利用掩码图像,我们设计了掩码增强块(MEB),可轻松插入 UNet 并增强语义条件。面向真实世界动画,我们提出一项新任务:外扩动画,其扩展了输入物体的空间与时间。在真实数据集上的大量实验表明,我们的方法取得了与现有 SOTA 方法相竞争的结果。

关键词

引用

@article{arxiv.2302.10781,
  title  = {Learning 3D Photography Videos via Self-supervised Diffusion on Single Images},
  author = {Xiaodong Wang and Chenfei Wu and Shengming Yin and Minheng Ni and Jianfeng Wang and Linjie Li and Zhengyuan Yang and Fan Yang and Lijuan Wang and Zicheng Liu and Yuejian Fang and Nan Duan},
  journal= {arXiv preprint arXiv:2302.10781},
  year   = {2023}
}

备注

10 pages, 7 figures