中文

X-NeMo:基于解耦潜在注意力的表现力神经动作重演

计算机视觉与模式识别 2025-08-01 v1

摘要

我们提出了X-NeMo,一种新颖的基于扩散的零样本肖像动画流水线,它利用来自不同个体的驱动视频中的面部动作来为静态肖像生成动画。我们的工作首先指出了先前方法中关键问题的根本原因,例如身份泄露以及难以捕捉微妙和极端的表情。为了应对这些挑战,我们引入了一个完全端到端的训练框架,从驱动图像中提取出1D身份无关的潜在动作描述符,在图像生成过程中通过交叉注意力有效控制动作。我们的隐式动作描述符从多样化的视频数据集中端到端地学习,捕捉了细节丰富的表现力面部动作,而不依赖于预训练的动作检测器。我们通过双重GAN解码器以及空间和颜色增强来监督其学习,进一步增强了表现力并将动作潜在表示与身份线索解耦。通过将驱动动作嵌入到1D潜在向量中并通过交叉注意力而非加性空间引导来控制动作,我们的设计消除了从驱动条件到扩散主干的空对齐结构线索的传递,从而大大减轻了身份泄露。大量实验表明,X-NeMo超越了最先进的基线方法,生成了具有高度表现力和优越身份相似度的动画。我们的代码和模型可供研究使用。

关键词

引用

@article{arxiv.2507.23143,
  title  = {X-NeMo: Expressive Neural Motion Reenactment via Disentangled Latent Attention},
  author = {Xiaochen Zhao and Hongyi Xu and Guoxian Song and You Xie and Chenxu Zhang and Xiu Li and Linjie Luo and Jinli Suo and Yebin Liu},
  journal= {arXiv preprint arXiv:2507.23143},
  year   = {2025}
}

备注

ICLR 2025, code is available at https://github.com/bytedance/x-nemo-inference