基于 3D 点轨迹的生成视频运动编辑
计算机视觉与模式识别
2025-12-02 v1
摘要
相机和物体运动是视频叙事的核心。然而,在复杂物体运动下精确编辑这些捕获的运动仍是一个重大挑战。当前的运动控制图像到视频 (I2V) 方法往往缺乏完整场景上下文以实现一致的视频编辑,而视频到视频 (V2V) 方法提供视角变化或基本物体平移,但对细粒度物体运动控制有限。我们提出一种基于 3D 点轨迹的轨迹条件 V2V 框架,实现相机和物体运动的联合编辑。通过以源视频和表示源运动与目标运动的配对 3D 点轨迹为条件,来实现此目标。这些 3D 轨迹建立稀疏对应关系,将丰富的上下文从源视频传递到新运动中,同时保持时空一致性。关键的是,与 2D 轨迹相比,3D 轨迹提供显式深度线索,使模型能够解析深度顺序并处理遮挡,从而实现精确运动编辑。在基于合成数据和真实数据的两阶段训练下,该模型支持多样化运动编辑,包括联合相机/物体操控、运动迁移和非刚性变形,开启了视频编辑的新创意潜力。
引用
@article{arxiv.2512.02015,
title = {Generative Video Motion Editing with 3D Point Tracks},
author = {Yao-Chih Lee and Zhoutong Zhang and Jiahui Huang and Jui-Hsien Wang and Joon-Young Lee and Jia-Bin Huang and Eli Shechtman and Zhengqi Li},
journal= {arXiv preprint arXiv:2512.02015},
year = {2025}
}
备注
Project page: https://edit-by-track.github.io