MagicPortrait: 基于三维几何引导的时间一致人脸重演
计算机视觉与模式识别
2025-10-30 v3
摘要
在本研究中,我们提出了一种视频人脸重演方法,将三维人脸参数模型整合到潜在扩散框架中,旨在改善现有基于视频的人脸生成方法中的形状一致性和运动控制。我们的方法采用FLAME(Faces Learned with an Articulated Model and Expressions)模型作为三维人脸参数表示,为建模人脸表情和头部姿态提供了统一框架。这不仅能够从驱动视频中精确提取运动特征,还有助于忠实保持人脸形状和几何结构。具体而言,我们通过从FLAME序列中提取深度图、法线图和渲染图来增强潜在扩散模型,这些图作为运动引导,并通过专门设计的几何引导编码器(GGE)编码到去噪UNet中。一个集成自注意力机制的多层特征融合模块用于在空间域中融合人脸外观和运动潜在特征。通过利用三维人脸参数模型作为运动引导,我们的方法实现了参考图像与驱动视频所捕获运动之间的人脸身份参数对齐。在基准数据集上的实验结果表明,我们的方法在生成高质量人脸动画方面表现出色,能够精确建模表情和头部姿态的变化。此外,它在跨域图像上展现出强大的泛化性能。代码已公开发布于 https://github.com/weimengting/MagicPortrait。
引用
@article{arxiv.2504.21497,
title = {MagicPortrait: Temporally Consistent Face Reenactment with 3D Geometric Guidance},
author = {Mengting Wei and Yante Li and Tuomas Varanka and Yan Jiang and Guoying Zhao},
journal= {arXiv preprint arXiv:2504.21497},
year = {2025}
}