中文

基于3D代理的Shape-for-Motion:精确且一致的视频编辑

计算机视觉与模式识别 2025-09-29 v2

摘要

近期的深度生成模型进展已开启了视频合成的前所未有的机遇。然而,在实际应用中,用户常常寻求工具以精确且一致地实现其创意编辑意图。尽管现有方法取得了进展,但确保与用户意图的细粒度对齐仍是开放且具有挑战性的问题。在本工作中,我们提出了Shape-for-Motion,一种新框架,利用3D代理实现精确且一致的视频编辑。Shape-for-Motion 通过将输入视频中目标对象转换为时间一致的网格(即3D代理),允许直接在代理上进行编辑,然后推断回视频帧。为简化编辑过程,我们设计了一种新的Dual-Propagation策略,允许用户仅在单个帧的3D网格上进行编辑,编辑随后自动传播到其他帧的3D网格。不同帧的3D网格进一步投影到2D空间,以产生编辑后的几何和纹理渲染,这些渲染作为解耦视频扩散模型输入,用于生成编辑结果。我们的框架支持各种精确且物理一致的跨视频帧操作,包括姿态编辑、旋转、缩放、平移、纹理修改和对象合成。我们的方法是通向高质量、可控视频编辑工作流程的关键一步。大量实验表明,我们的方法在优越性和有效性方面显著优于现有方法。项目页面: https://shapeformotion.github.io/

关键词

引用

@article{arxiv.2506.22432,
  title  = {Shape-for-Motion: Precise and Consistent Video Editing with 3D Proxy},
  author = {Yuhao Liu and Tengfei Wang and Fang Liu and Zhenwei Wang and Rynson W. H. Lau},
  journal= {arXiv preprint arXiv:2506.22432},
  year   = {2025}
}

备注

Accepted by Siggraph Asia 2025