中文

Motion Marionette:通过先验引导重新思考刚性运动传递

计算机视觉与模式识别 2025-11-26 v1

摘要

我们提出了 Motion Marionette,一个用于从单目源视频将刚性运动传递到单视图目标图像的零样本框架。以往的工作通常采用几何、生成或仿真先验来指导传递过程,但这些外部先验会引入附加约束,导致通用性与时序一致性之间存在权衡。为解决这些限制,我们提出通过仅捕获空间时间变换且在源视频和任何传递目标视频之间共享的内部先验来指导运动传递过程。具体而言,我们首先将源视频和目标图像提升到统一的三维表示空间中。随后从源视频中提取运动轨迹,以构建独立于对象几何和语义的空间时间(SpaT)先验,编码随时间的相对空间变化。该先验进一步与目标对象集成,以合成可控速度场,并通过基于位置的动力学进行细化,以减轻伪影并增强视觉连贯性。最终得到的速度场可灵活应用于高效视频制作。实证结果表明,Motion Marionette 在 diverse objects 上具有良好的泛化能力,产生的时序一致视频与源运动对齐良好,并且支持可控视频生成。

关键词

引用

@article{arxiv.2511.19909,
  title  = {Motion Marionette: Rethinking Rigid Motion Transfer via Prior Guidance},
  author = {Haoxuan Wang and Jiachen Tao and Junyi Wu and Gaowen Liu and Ramana Rao Kompella and Yan Yan},
  journal= {arXiv preprint arXiv:2511.19909},
  year   = {2025}
}