中文

Puppet-Master:将交互式视频生成作为运动先验用于部件级动力学

计算机视觉与模式识别 2025-08-29 v2 人工智能

摘要

我们介绍了 Puppet-Master,这是一种能够捕捉物体内部、部件级运动的交互式视频生成器,可作为建模普遍对象动力学的代理。给定一个物体图像和一组指定物体几何点轨迹的"拖拽",模型会合成该物体各部件按相应方式移动的视频。为构建 Puppet-Master,我们扩展了预训练的图像到视频生成器以编码输入拖拽。我们还提出了全到第一个注意力机制,这是一种针对常规空间注意力的替代方案,可缓解因在域外数据上微调视频生成器而产生的伪影。该模型在 Objaverse-Animation-HQ 数据集上进行微调,该数据集由渲染合成 3D 动画获得的精选部件级运动剪辑组成。与真实视频不同,这些合成剪辑避免了将部件级运动与整体物体和相机运动混淆。我们对动画进行了广泛筛选,并用强化拖拽来突出物体内部动力学。我们展示了 Puppet-Master 能够学习生成部件级运动,而其他运动条件视频生成器主要将物体整体移动。此外,Puppet-Master 对域外真实图像具有良好泛化能力,在零样本方式下在真实世界基准测试中超越现有方法。

关键词

引用

@article{arxiv.2408.04631,
  title  = {Puppet-Master: Scaling Interactive Video Generation as a Motion Prior for Part-Level Dynamics},
  author = {Ruining Li and Chuanxia Zheng and Christian Rupprecht and Andrea Vedaldi},
  journal= {arXiv preprint arXiv:2408.04631},
  year   = {2025}
}

备注

Accepted at ICCV 2025. Project page: https://vgg-puppetmaster.github.io/