中文

Time-to-Move:基于双时钟去噪的无训练运动控制视频生成

计算机视觉与模式识别 2025-11-13 v1 人工智能 图形学 机器学习 多媒体

摘要

基于扩散的视频生成可以创建逼真的视频,然而现有的基于图像和文本的条件生成无法提供精确的运动控制。先前的运动条件合成方法通常需要针对特定模型进行微调,这在计算上既昂贵又具有限制性。我们引入了 Time-to-Move (TTM),一个无训练、即插即用的框架,用于结合图像到视频 (I2V) 扩散模型进行运动和外观控制的视频生成。我们的核心见解是使用通过剪切拖拽或基于深度重投影等用户友好操作获得的粗糙参考动画。受 SDEdit 在图像编辑中使用粗略布局线索的启发,我们将粗糙动画视为粗略运动线索,并将该机制适配到视频领域。我们利用图像条件保持外观,并引入双时钟去噪,这是一种依赖于区域的策略,在运动指定区域强制严格对齐,同时在其他区域允许灵活性,从而在用户意图的保真度与自然动态之间取得平衡。这种对采样过程的轻量级修改不产生额外的训练或运行时成本,并且与任何骨干网络兼容。在物体和相机运动基准上的大量实验表明,TTM 在真实感和运动控制方面匹配或超越了现有的基于训练的基线方法。除此之外,TTM 引入了一项独特能力:通过像素级条件生成进行精确的外观控制,超越了仅文本提示的限制。访问我们的项目页面获取视频示例和代码:https://time-to-move.github.io/。

关键词

引用

@article{arxiv.2511.08633,
  title  = {Time-to-Move: Training-Free Motion Controlled Video Generation via Dual-Clock Denoising},
  author = {Assaf Singer and Noam Rotstein and Amir Mann and Ron Kimmel and Or Litany},
  journal= {arXiv preprint arXiv:2511.08633},
  year   = {2025}
}