中文

HumanDiT: 基于姿态引导的扩散 Transformer 用于长时段人类运动视频生成

计算机视觉与模式识别 2025-08-05 v5

摘要

人类运动视频生成取得了显著进展,但现有方法仍在长序列和复杂运动中难以准确渲染手部和面部等细节部位。当前方法也依赖固定分辨率,难以维持视觉一致性。为此,我们提出 HumanDiT,一个基于姿态引导的扩散 Transformer(DiT)-框架,训练于包含 14,000 小时高质量视频的大规模野生数据集,以生成高保真度视频并实现细粒度人体渲染。具体而言:(i) HumanDiT 基于 DiT,支持多种视频分辨率和可变序列长度,促进长序列视频生成的学习;(ii) 我们引入前缀潜在参考策略以维持延长序列中的个性特征。此外,在推理期间,HumanDiT 利用 Keypoint-DiT 生成后续姿态序列,实现从静态图像或现有视频的视频续写。它还利用姿态适配器(Pose Adapter)实现姿态迁移。大量实验表明,其在多样化场景下生成长时段、姿态精准视频的性能卓越。

关键词

引用

@article{arxiv.2502.04847,
  title  = {HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation},
  author = {Qijun Gan and Yi Ren and Chen Zhang and Zhenhui Ye and Pan Xie and Xiang Yin and Zehuan Yuan and Bingyue Peng and Jianke Zhu},
  journal= {arXiv preprint arXiv:2502.04847},
  year   = {2025}
}

备注

https://agnjason.github.io/HumanDiT-page/