中文

FactorPortrait:通过解缠分离的表情、姿态和视角实现可控人像动画

计算机视觉与模式识别 2025-12-15 v1

摘要

我们介绍FactorPortrait,这是一种用于可控人像动画的视频扩散方法,能够通过解缠分离的面部表情、头部运动和摄像机视角控制信号实现逼真的合成。给定一个单张人像图像,一个驾驶视频,以及摄像机轨迹,我们的方法通过在保持同时支持来自任意视角的新颖视图合成的前提下,将驾驶视频中的面部表情和头部运动传递给人像。我们利用预训练的图像编码器从驾驶视频中提取面部表情潜在特征作为动画生成的控制信号。这些潜在特征在身份和姿态信息被解缠后,能够隐式捕捉细腻的面部表情动态特性,并通过我们提出的表情控制器高效注入到视频扩散变换器中。对于摄像机和头部姿态控制,我们采用从 3D 身体网格跟踪渲染的 Pl"ucker 射线图和法线图。为了训练我们的模型,我们构建了一个包含多样化摄像机视角、头部姿态和面部表情动态组合的大规模合成数据集。广泛的实验表明,我们的方法在逼真度、表达性、控制精度和视角一致性方面均优于现有方法。

关键词

引用

@article{arxiv.2512.11645,
  title  = {FactorPortrait: Controllable Portrait Animation via Disentangled Expression, Pose, and Viewpoint},
  author = {Jiapeng Tang and Kai Li and Chengxiang Yin and Liuhao Ge and Fei Jiang and Jiu Xu and Matthias Nießner and Christian Häne and Timur Bagautdinov and Egor Zakharov and Peihong Guo},
  journal= {arXiv preprint arXiv:2512.11645},
  year   = {2025}
}

备注

Project page: https://tangjiapeng.github.io/FactorPortrait/