中文

DreamActor-M1:基于混合指导的全方位、表达性且稳健的人像图像动画

计算机视觉与模式识别 2025-04-22 v3 人工智能

摘要

虽然最近的基于图像的人类动画方法在逼真的身体和面部运动合成方面取得了进展,但仍存在细粒度全方位可控性、多尺度适应性和长期时间一致性等关键缺失,导致其表达性和稳健性较差。我们提出一种基于扩散转换器(Diffusion Transformer, DiT)的框架,称为 DreamActor-M1,采用混合指导来克服这些限制。对于运动指导,我们的混合控制信号整合了隐式面部表示、3D 头部球体和 3D 身体骨架,实现了对面部表情和身体动作的稳健控制,同时生成具有表达性和身份保持性的动画。对于尺度适应,为处理各种身体姿态和图像尺度(从人物特写到全身视图),我们采用基于不同分辨率和尺度数据进行的渐进式训练策略。对于外观指导,我们整合来自连续帧的运动模式与互补的视觉参考,确保在复杂运动期间对未知区域的长期时间一致性。实验表明,我们的方法优于现有的先进方法,能够为人物特写、上半身和全身生成具有表达性且稳健的长期一致结果。项目页面:https://grisoon.github.io/DreamActor-M1/。

关键词

引用

@article{arxiv.2504.01724,
  title  = {DreamActor-M1: Holistic, Expressive and Robust Human Image Animation with Hybrid Guidance},
  author = {Yuxuan Luo and Zhengkun Rong and Lizhen Wang and Longhao Zhang and Tianshu Hu and Yongming Zhu},
  journal= {arXiv preprint arXiv:2504.01724},
  year   = {2025}
}