中文

基于视频先验的快速多视图一致 3D 编辑

计算机视觉与模式识别 2025-12-02 v2

摘要

文本驱动的 3D 编辑使用户能够通过文本指令进行 3D 对象或场景编辑。由于缺乏多视图一致性先验,现有方法通常依赖针对每个视图单独处理的 2D 生成或编辑模型,随后进行迭代的 2D-3D-2D 更新。然而,这些方法既耗时,又容易导致过平滑的结果,因为来自不同视图的不同编辑信号在迭代过程中被平均。本文提出了基于生成式视频先验的 3D 编辑框架 (ViP3DE),利用预训练视频生成模型的时序一致性先验,在单次前向传播中实现多视图一致的 3D 编辑。我们的关键思想是将视频生成模型条件化于单个编辑视图,以直接生成其他一致编辑视图用于 3D 更新,从而绕过迭代编辑范式。由于 3D 更新需要编辑视图搭配特定相机姿态,本文提出了保持运动的噪声混合技术,使视频模型可在预定义相机姿态下生成编辑视图。此外,我们引入几何感知去噪,以整合 3D 几何先验来进一步增强多视图一致性。广泛的实验表明,我们提出的 ViP3DE 可在单次前向传播中实现高质量的 3D 编辑结果,在编辑质量和速度方面显著优于现有方法。

关键词

引用

@article{arxiv.2511.23172,
  title  = {Fast Multi-view Consistent 3D Editing with Video Priors},
  author = {Liyi Chen and Ruihuang Li and Guowen Zhang and Pengfei Wang and Lei Zhang},
  journal= {arXiv preprint arXiv:2511.23172},
  year   = {2025}
}

备注

accepted by AAAI2026