中文

StableAnimator:高质量身份保持的人类图像动画

计算机视觉与模式识别 2024-11-28 v2 人工智能

摘要

当前用于人类图像动画的扩散模型在确保身份(ID)一致性方面存在挑战。本文提出了 StableAnimator,这是首个 end-to-end ID-preserving video diffusion 框架,能够在没有任何后处理的情况下合成高质量视频,条件为参考图像和姿态序列。基于 video diffusion 模型,StableAnimator 包含经过精心设计的训练和推理模块,旨在实现身份一致性。特别地,StableAnimator 通过离线方式计算图像和面部嵌入,分别使用现成的提取器,面部嵌入经与图像嵌入相互作用后由名为 Face Encoder 的全局内容感知模块进一步细化。然后,StableAnimator 引入一种新颖的 distribution-aware ID Adapter,通过对齐来防止 temporal 层造成的干扰,同时保持 ID。推理期间,我们提出了一种基于 Hamilton-Jacobi-Bellman(HJB)方程的优化进一步提升面部质量。我们展示了求解 HJB 方程可以集成到扩散去噪过程中,所得解对去噪路径施加约束,从而有利于 ID 保持。在多个基准测试上进行实验显示,StableAnimator 在定性和定量分析方面均有效。

关键词

引用

@article{arxiv.2411.17697,
  title  = {StableAnimator: High-Quality Identity-Preserving Human Image Animation},
  author = {Shuyuan Tu and Zhen Xing and Xintong Han and Zhi-Qi Cheng and Qi Dai and Chong Luo and Zuxuan Wu},
  journal= {arXiv preprint arXiv:2411.17697},
  year   = {2024}
}