中文

Characterizing Motion Encoding in Video Diffusion Timesteps

计算机视觉与模式识别 2025-12-30 v1 人工智能 图像与视频处理

摘要

文本到视频扩散模型通过迭代去噪合成时间运动和空间外观,但如何在时间步中编码运动仍不完全理解。实践中, practitioners 常利用经验法则:即早期时间步主要塑造运动和布局,而后期时间步则细化外观,但这种行为尚未系统地加以 characterize。本 work 通过在指定时间步范围内注入新条件引起的 appearance 编辑与 motion 保存之间的 trade-off 来代理视频扩散时间步中的运动编码,并通过大规模定量研究对该代理进行 characterize。该协议允许我们通过定量映射如何沿去噪轨迹对运动和外观进行竞争。跨越 diverse architectures,我们一致识别出早期的运动主导时段和后期的外观主导时段,形成时间步空间中的 operational motion-appearance boundary。基于这一 characterize,我们简化当前单次运动定制范例,限制训练和推理仅在运动主导时段,从而在无需辅助去偏模块或专用目标的情况下实现强大的运动迁移。我们的分析将广泛使用的经验法则转化为时空解耦原则,我们的时间步受限配方可作为现有运动迁移和编辑方法的即插即用集成。

关键词

引用

@article{arxiv.2512.22175,
  title  = {Characterizing Motion Encoding in Video Diffusion Timesteps},
  author = {Vatsal Baherwani and Yixuan Ren and Abhinav Shrivastava},
  journal= {arXiv preprint arXiv:2512.22175},
  year   = {2025}
}

备注

10 pages, 4 figures