中文

MultiAnimate:可扩展的姿态引导图像动画

计算机视觉与模式识别 2026-05-12 v2

摘要

姿态引导的人类图像动画旨在合成由参考角色驱动的序列姿态构成的逼真视频。虽然扩散方法已取得显著成功,但大多数现有方法仅限于单角色动画。我们观察到,将这些方法直接扩展到多角色场景常常导致身份混淆和不合理的遮挡。为解决这些挑战,本文提出了一个基于现代扩散转换器(DiTs)构建的可扩展多角色图像动画框架。其核心引入了两个新组件——标识分配器和标识适配器——共同捕获每个人的定位线索和人与人之间的空间关系。这种基于掩码的方案以及可扩展的训练策略不仅提升了灵活性,也使模型能够泛化到训练时未见过的更多角色的场景。值得注意的是,仅在两个角色数据集上训练的模型,即可实现多角色动画,同时保持与单角色情况的兼容性。大量实验表明,我们的方法在多角色图像动画方面实现了最佳性能,超越了现有的扩散方法基线。

关键词

引用

@article{arxiv.2602.21581,
  title  = {MultiAnimate: Pose-Guided Image Animation Made Extensible},
  author = {Yingcheng Hu and Haowen Gong and Chuanguang Yang and Zhulin An and Yongjun Xu and Songhua Liu},
  journal= {arXiv preprint arXiv:2602.21581},
  year   = {2026}
}

备注

CVPR2026 Accepted. Project page at https://hyc001.github.io/MultiAnimate/