中文

HumanDreamer: 通过解耦生成可控人类运动视频

计算机视觉与模式识别 2025-04-02 v2

摘要

人类运动视频生成一直是一个具有挑战性的任务,主要是由于学习人类身体运动的困难。虽然一些方法尝试通过姿态控制显式驱动人类中心视频生成,但这些方法通常依赖于来自现有视频的姿态,缺乏灵活性。为此,我们提出了HumanDreamer,一种解耦的人类视频生成框架,该框架首先从文本提示生成多样化姿态,然后利用这些姿态生成人类运动视频。具体而言,我们提出了MotionVid,人类运动姿态生成的数据集最大。基于该数据集,我们提出了MotionDiT,该模型训练用于从文本提示生成结构化的人类运动姿态。此外,我们引入了新的LAMA损失,显著提高了FID指标62.4%,并在top1、top2和top3的R-precision分别提高41.8%、26.3%和18.3%,从而推动了文本到姿态控制精度和FID指标的整体提升。我们的实验在各种姿态到视频基线方法上表明,我们的方法生成的姿态可以产生多样且高质量的人类运动视频。此外,我们的模型可以促进其他下游任务,如姿态序列预测和2D-3D运动升降。

关键词

引用

@article{arxiv.2503.24026,
  title  = {HumanDreamer: Generating Controllable Human-Motion Videos via Decoupled Generation},
  author = {Boyuan Wang and Xiaofeng Wang and Chaojun Ni and Guosheng Zhao and Zhiqin Yang and Zheng Zhu and Muyang Zhang and Yukun Zhou and Xinze Chen and Guan Huang and Lihong Liu and Xingang Wang},
  journal= {arXiv preprint arXiv:2503.24026},
  year   = {2025}
}

备注

Project Page: https://humandreamer.github.io