中文

StableAnimator++:克服姿态错位与面部变形的人类图像动画

计算机视觉与模式识别 2025-07-22 v1 人工智能

摘要

当前的人类图像动画扩散模型在维持身份一致性方面常常困难,尤其当参考图像与驾驶视频在身体尺寸或位置上差异显著时。我们引入StableAnimator++,这是首个具备可学习姿态对齐功能且能够在无任何后处理的情况下,依据参考图像和姿态序列生成高质量视频的身份保持视频扩散框架。基于视频扩散模型,StableAnimator++包含精心设计的训练和推理模块,以实现身份一致性。具体而言,StableAnimator++首先通过注入奇异值分解(SVD)的引导信息,使用可学习层预测参考图像与驾驶姿态之间的相似性变换矩阵。这些矩阵将驾驶姿态与参考图像对齐,从而大幅缓解了姿态错位问题。随后,StableAnimator++使用通用编码器计算图像和面部嵌入,并通过全局内容感知面部编码器细化面部嵌入。为进一步维持身份一致性,我们引入分布感知的身份适配器(distribution-aware ID Adapter),以分布对齐方式抵消时间层造成的干扰。推理阶段,我们提出一种基于Hamilton-Jacobi-Bellman(HJB)的人脸优化方案集成到去噪过程中,引导扩散轨迹以实现更高的面部保真度。基准测试的实验结果表明,StableAnimator++在定性和定量分析上均有效。

关键词

引用

@article{arxiv.2507.15064,
  title  = {StableAnimator++: Overcoming Pose Misalignment and Face Distortion for Human Image Animation},
  author = {Shuyuan Tu and Zhen Xing and Xintong Han and Zhi-Qi Cheng and Qi Dai and Chong Luo and Zuxuan Wu and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2507.15064},
  year   = {2025}
}

备注

arXiv admin note: substantial text overlap with arXiv:2411.17697