点到点:稀疏运动引导用于可控视频编辑
计算机视觉与模式识别
2025-11-25 v1
摘要
在视频编辑任务中准确保留运动仍是核心挑战。现有方法常在编辑保真度和运动保真度之间进行权衡,因为它们依赖的运动表示要么过度适应布局,要么仅隐式定义。为克服这一限制,我们重新审视基于点的运动表示方法。然而,在没有人类输入的情况下,尤其是在跨越多样化视频情景时,确定有意义的点仍具有挑战性。为此,我们提出一种新型运动表示——锚定 token,通过利用视频扩散模型的丰富先验捕获最本质的运动模式。锚定 token 通过少量信息点轨迹紧凑地编码视频动力学,并且可以灵活地重新定位以与新主体对齐。这使得我们的方法——点到点(Point-to-Point)能够在多样化情景中获得推广性。广泛的实验表明,锚定 token 导致更可控且语义对齐的视频编辑,在编辑保真度和运动保真度方面实现卓越的性能。
引用
@article{arxiv.2511.18277,
title = {Point-to-Point: Sparse Motion Guidance for Controllable Video Editing},
author = {Yeji Song and Jaehyun Lee and Mijin Koo and JunHoo Lee and Nojun Kwak},
journal= {arXiv preprint arXiv:2511.18277},
year = {2025}
}