中文

DreamActor-M2:基于时空上下文学习的通用人物图像动画

计算机视觉与模式识别 2026-01-30 v1 人工智能

摘要

人物图像动画旨在通过将驱动序列的运动传递到静态参考图像上来合成高保真视频。尽管近期取得的进展,但现有方法存在两个根本性挑战:(1)运动注入策略次优,导致身份保持与运动一致性之间存在权衡,表现为“摇摆”式问题;(2)过度依赖显式姿态先验(如骨架),这些先验不足以捕捉复杂的动态,阻碍了对任意非人类化角色的泛化。为此,我们提出 DreamActor-M2,一个通用动画框架,重新构想运动条件作为一种情境学习问题。我们的方法遵循两个阶段的范式。首先,我们通过将参考外观和运动线索融合到统一的潜在空间中,来弥合输入模态之间的差距,使模型能够利用基础模型的生成先验,联合推理空间身份和时间动态。其次,我们引入一种自引导的数据合成管道,用于筛选伪跨身份训练对,实现从姿态依赖控制到直接以像素级 RGB 为驱动的端到端动画的无缝过渡。该策略显著增强了在多样化角色和运动情景下的泛化能力。为便于全面评估,我们进一步引入了 AW Bench—a 一个涵盖广泛角色类型和运动情景的通用基准。广泛的实验表明,DreamActor-M2 实现了最先进的性能,提供卓越的视觉保真度和稳健的跨域泛化。项目页面:https://grisoon.github.io/DreamActor-M2/

关键词

引用

@article{arxiv.2601.21716,
  title  = {DreamActor-M2: Universal Character Image Animation via Spatiotemporal In-Context Learning},
  author = {Mingshuang Luo and Shuang Liang and Zhengkun Rong and Yuxuan Luo and Tianshu Hu and Ruibing Hou and Hong Chang and Yong Li and Yuan Zhang and Mingyuan Gao},
  journal= {arXiv preprint arXiv:2601.21716},
  year   = {2026}
}