中文

DeX-Portrait:通过显式与隐式运动表示实现解耦且富有表现力的人像动画

计算机视觉与模式识别 2025-12-18 v1

摘要

从单张源图像和驱动视频进行人像动画是一个长期存在的问题。近年来的方法倾向于采用基于扩散的图像/视频生成模型以实现真实且富有表现力的动画。然而,这些扩散模型中没有一个实现了头部姿态与面部表情之间的高保真解耦控制,阻碍了诸如仅表情或仅姿态编辑与动画等应用。为解决这一问题,我们提出 DeX-Portrait,一种能够生成由解耦的姿态和表情信号驱动的富有表现力的人像动画的新方法。具体而言,我们将姿态表示为显式的全局变换,将表情表示为隐式的隐式编码。首先,我们设计了一个强大的运动训练器来学习姿态和表情编码器,以提取精确且分解的驱动信号。然后我们提出通过双分支条件机制将姿态变换注入扩散模型,并通过交叉注意力注入表情隐式编码。最后,我们设计了渐进式混合无分类器引导以实现更忠实的一致性。实验表明,我们的方法在动画质量和解耦可控性方面均优于最先进基线方法。

关键词

引用

@article{arxiv.2512.15524,
  title  = {DeX-Portrait: Disentangled and Expressive Portrait Animation via Explicit and Latent Motion Representations},
  author = {Yuxiang Shi and Zhe Li and Yanwen Wang and Hao Zhu and Xun Cao and Ligang Liu},
  journal= {arXiv preprint arXiv:2512.15524},
  year   = {2025}
}

备注

Projectpage: https://syx132.github.io/DeX-Portrait/