JOLT3D:联合学习说话者头部与 3DMM 参数及其在口同步中的应用
计算机视觉与模式识别
2025-07-29 v1
摘要
本文重新审视了 3DMM 在说话者头部合成中的有效性,通过联合学习 3D 人脸重建模型和说话者头部合成模型来实现这一目标。这使我们能够获得针对说话者头部合成优化的 FACS-based blendshape 表示。与以往方法不同,后者要么将 3DMM 参数拟合到 2D 特征点,要么依赖预训练的人脸重建模型。我们的方法不仅提高了生成人脸的质量,还允许我们利用 blendshape 表示仅修改口部区域,以实现基于音频的口同步。为此,我们提出了一种新颖的口同步管道,该管道不同于以往方法,解耦了原始下巴轮廓与口同步下巴轮廓,减少了口部附近的 flickering 现象。
关键词
引用
@article{arxiv.2507.20452,
title = {JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync},
author = {Sungjoon Park and Minsik Park and Haneol Lee and Jaesub Yun and Donggeon Lee},
journal= {arXiv preprint arXiv:2507.20452},
year = {2025}
}
备注
10 + 8 pages, 11 figures