中文

MimicMotion:基于置信度感知姿态引导的高质量人体运动视频生成

计算机视觉与模式识别 2025-06-30 v2 人工智能 多媒体

摘要

近年来,生成式人工智能在图像生成领域取得了显著进展,催生了各种应用。然而,视频生成在诸多方面仍面临较大挑战,如可控性、视频长度和细节丰富性,这些都阻碍了该技术的应用和普及。在本工作中,我们提出一种可控视频生成框架,称为 MimicMotion,能够生成特定运动指导下的任意长度高质量视频。与以往方法相比,我们的方法具有多个亮点。首先,我们引入置信度感知姿态引导,确保高帧质量和时间平滑性。其次,我们引入基于姿态置信度的区域损失放大,显著减少图像失真。最后,为了生成长而平滑的视频,我们提出一种渐进式潜在融合策略。通过这一方式,我们可以在可接受的资源消耗下生成任意长度的视频。通过大量实验和用户研究,MimicMotion 在诸多方面均显著优于以往方法。详细结果和比较可在我们的项目页面上查阅:https://tencent.github.io/MimicMotion。

关键词

引用

@article{arxiv.2406.19680,
  title  = {MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance},
  author = {Yuang Zhang and Jiaxi Gu and Li-Wen Wang and Han Wang and Junqi Cheng and Yuefeng Zhu and Fangyuan Zou},
  journal= {arXiv preprint arXiv:2406.19680},
  year   = {2025}
}

备注

ICML 2025