中文

基于扩散先验的单目视频动态视图合成

计算机视觉与模式识别 2024-01-12 v1

摘要

动态新视图合成旨在捕捉视频中视觉内容的时间演化。现有方法难以区分运动与结构,尤其是在相机位姿未知或相对于物体运动受限的场景中。此外,仅凭参考图像的信息,要生成给定视频中被遮挡或仅部分观察到的不可见区域极具挑战性。为解决这些问题,我们首先使用定制化技术在视频帧上微调一个预训练的 RGB-D 扩散模型。随后,我们将微调模型的知识蒸馏到一个包含动态与静态神经辐射场(NeRF)组件的 4D 表示中。所提出的流程在保持场景身份的同时实现了几何一致性。我们进行了全面的实验,定性和定量地评估了所提方法的有效性。我们的结果证明了该方法在挑战性场景下的鲁棒性和实用性,进一步推动了动态新视图合成的发展。

关键词

引用

@article{arxiv.2401.05583,
  title  = {Diffusion Priors for Dynamic View Synthesis from Monocular Videos},
  author = {Chaoyang Wang and Peiye Zhuang and Aliaksandr Siarohin and Junli Cao and Guocheng Qian and Hsin-Ying Lee and Sergey Tulyakov},
  journal= {arXiv preprint arXiv:2401.05583},
  year   = {2024}
}