中文

V2Edit:用于视频和 3D 场景的多功能视频扩散编辑器

计算机视觉与模式识别 2025-03-18 v2

摘要

本文介绍了 V²Edit,一个用于指令引导视频和 3D 场景编辑的新型无训练框架。针对在保持原始内容与完成编辑任务之间取得平衡的关键挑战,我们的方法采用渐进策略,将复杂编辑任务分解为一系列更简单的子任务。每个子任务通过三个关键协同机制控制:初始噪声、每个去噪步骤中添加的噪声,以及文本提示与视频内容之间的交叉注意力图。这确保了原始视频元素的稳健保持,同时有效应用所需编辑。除了其原生视频编辑能力外,我们通过"渲染-编辑-重建"过程将 V²Edit 扩展到 3D 场景编辑,即使在面对对象插入等涉及大量几何变化的任务时,也能实现高质量、3D 一致的编辑。广泛实验表明,我们的 V²Edit 在各种具有挑战性的视频编辑任务和复杂 3D 场景编辑任务中均实现了高质量和成功的编辑,从而在这两个领域建立了最先进性能。

关键词

引用

@article{arxiv.2503.10634,
  title  = {V2Edit: Versatile Video Diffusion Editor for Videos and 3D Scenes},
  author = {Yanming Zhang and Jun-Kun Chen and Jipeng Lyu and Yu-Xiong Wang},
  journal= {arXiv preprint arXiv:2503.10634},
  year   = {2025}
}

备注

Project Website: https://immortalco.github.io/V2Edit/