中文

DisMo:用于开放世界运动传递的解缠运动表示

计算机视觉与模式识别 2025-12-01 v1

摘要

最近的文本到视频 (T2V) 和图像到视频 (I2V) 模型进展,使我们能够从简单的文本描述或初始帧中创建视觉上引人入胜且充满动态性的视频。 然而,这些模型常常未能为内容与运动提供明确的分离表示,限制了其在内容创作者中的应用。 为了解决这一问题,我们提出DisMo,一种通过图像空间重建目标从原始视频数据中直接学习抽象运动表示的新范式。 我们的表示是通用的,独立于诸如外观、物体身份或姿态等静态信息。这使得能够进行开放世界运动传递,允许在没有物体对应关系的情况下进行运动传递,甚至可以在截然不同的类别之间进行。 与先前方法不同,后者在运动保真度和提示遵循度之间进行权衡, 或对来源结构过度拟合, 或偏离所描述的动作而产生漂移,我们的方法将运动语义与外观解缠, 实现准确传递和可靠条件控制。 此外,我们的运动表示可以与任何现有的视频生成器结合,通过轻量级适配器实现,从而轻松受益于未来视频模型的进展。 我们通过多样化的运动传递任务演示了该方法的有效性。 此外,我们显示所学表示适合用于下游运动理解任务,在Something-Something v2和Jester等基准测试上 consistently outperform 现有的SOTA视频表示模型如V-JEPA。 项目页面:https://compvis.github.io/DisMo

关键词

引用

@article{arxiv.2511.23428,
  title  = {DisMo: Disentangled Motion Representations for Open-World Motion Transfer},
  author = {Thomas Ressler-Antal and Frank Fundel and Malek Ben Alaya and Stefan Andreas Baumann and Felix Krause and Ming Gui and Björn Ommer},
  journal= {arXiv preprint arXiv:2511.23428},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025