中文

MotionGrounder: 基于扩散 Transformer 的 grounded 多目标运动迁移

计算机视觉与模式识别 2026-04-02 v1

摘要

运动迁移通过将参考视频中的时间动力学迁移到以目标描述为条件以合成新视频,从而实现可控的视频生成。然而,现有的基于扩散 Transformer (DiT) 的方法仅限于单对象视频,限制了在包含多个对象的真实场景中进行的细粒度控制。本文引入 MotionGrounder,一个基于 DiT 的框架,首次处理具有多对象可控性的运动迁移问题。MotionGrounder 中的基于流的运动信号 (FMS) 提供了目标视频生成的稳定运动先验,同时我们的对象-描述对齐损失 (OCAL) 将对象描述锚定到其对应的空间区域。我们进一步提出了一种新的对象 grounding score (OGS),该得分同时评估 (i) 源视频中对象的空间对齐程度与其生成版本之间的对齐程度,以及 (ii) 每个生成对象与其目标描述之间的语义一致性。我们的实验表明,MotionGrounder 在定性、定量以及人类评估方面均 consistently 优于最近的基线方法。

关键词

引用

@article{arxiv.2604.00853,
  title  = {MotionGrounder: Grounded Multi-Object Motion Transfer via Diffusion Transformer},
  author = {Samuel Teodoro and Yun Chen and Agus Gunawan and Soo Ye Kim and Jihyong Oh and Munchurl Kim},
  journal= {arXiv preprint arXiv:2604.00853},
  year   = {2026}
}

备注

Please visit our project page at https://kaist-viclab.github.io/motiongrounder-site/