中文

DynVideo-E:利用动态NeRF进行大规模运动与视角变化以人为中心视频编辑

计算机视觉与模式识别 2023-12-11 v2

摘要

尽管基于扩散的视频编辑近期取得进展,现有方法由于长程一致性与逐帧编辑之间的矛盾而局限于短长度视频。先前通过引入视频-2D表示来解决此挑战的尝试,在大规模运动与视角变化视频上遇到显著困难,尤其在以人为中心的场景中。为克服这一点,我们提出引入动态神经辐射场(NeRF)作为创新视频表示,其中编辑可在3D空间中执行并通过形变场传播至整个视频。为提供一致且可控的编辑,我们提出基于图像的视频-NeRF编辑流程,带有一组创新设计,包括来自2D个性化扩散先验和3D扩散先验的多视角多姿态分数蒸馏采样(SDS)、重建损失、文本引导局部部件超分辨率以及风格迁移。大量实验表明,我们的方法(称为DynVideo-E)在两个具有挑战性的数据集上以50% ~ 95%的大幅度 human preference 优于SOTA方法。代码将发布于 https://showlab.github.io/DynVideo-E/。

关键词

引用

@article{arxiv.2310.10624,
  title  = {DynVideo-E: Harnessing Dynamic NeRF for Large-Scale Motion- and View-Change Human-Centric Video Editing},
  author = {Jia-Wei Liu and Yan-Pei Cao and Jay Zhangjie Wu and Weijia Mao and Yuchao Gu and Rui Zhao and Jussi Keppo and Ying Shan and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2310.10624},
  year   = {2023}
}

备注

Project Page: https://showlab.github.io/DynVideo-E/