中文

RealisMotion:世界空间中的分解式人体运动控制与视频生成

计算机视觉与模式识别 2025-08-13 v1 图像与视频处理

摘要

生成具有逼真且可控运动的人体视频是一项具有挑战性的任务。现有方法虽能生成视觉上引人入胜的视频,但缺乏对四个关键视频元素的独立控制:前景主体、背景视频、人体轨迹和动作模式。本文提出一种分解式人体运动控制与视频生成框架,将运动与外观、主体与背景、动作与轨迹显式解耦,从而实现这些元素的灵活混搭组合。具体而言,我们首先构建一个地面感知的三维世界坐标系,并直接在三维空间中进行运动编辑。轨迹控制通过焦距校准和坐标变换将编辑后的二维轨迹反投影至三维空间,随后进行速度对齐和方向调整来实现;动作则由动作库提供或通过文本到动作方法生成。然后,基于现代文本到视频扩散Transformer模型,我们将主体作为令牌注入以进行全注意力计算,沿通道维度拼接背景,并通过加法添加运动(轨迹和动作)控制信号。这种设计使我们能够生成任何人在任何地方做任何事的逼真视频。在基准数据集和真实场景上的大量实验表明,我们的方法在元素级可控性和整体视频质量方面均达到了最先进的性能。

关键词

引用

@article{arxiv.2508.08588,
  title  = {RealisMotion: Decomposed Human Motion Control and Video Generation in the World Space},
  author = {Jingyun Liang and Jingkai Zhou and Shikai Li and Chenjie Cao and Lei Sun and Yichen Qian and Weihua Chen and Fan Wang},
  journal= {arXiv preprint arXiv:2508.08588},
  year   = {2025}
}

备注

Project page: https://jingyunliang.github.io/RealisMotion