GGTalker:基于可泛化高斯先验和身份特定适应的语音驱动3D说话人合成
计算机视觉与模式识别
2025-07-11 v2
摘要
创建高质量、可泛化的语音驱动3D说话人仍是一个持久的挑战。以往的方法在固定视点和小规模音频变化方面取得满意的结果,但在大幅旋转和分布外 (OOD) 音频方面存在困难。此外,这些方法受限于需要耗时的身份特定训练。我们认为核心问题在于缺乏足够的3D先验,这限制了合成说话人外推能力。为此,我们提出GGTalker,通过可泛化先验和身份特定适应的结合来合成说话人。我们提出了两个阶段的先验-适应训练策略,以学习高斯说话人先验并适应个体特征。我们训练音频-表情和表情-视觉先验,以捕获唇部运动的通用模式和头部纹理的通用分布。在定制化适应期间,个体说话风格和纹理细节被精确建模。此外,我们引入颜色MLP来生成细粒度、运动对齐的纹理,并引入身体填充器将渲染结果与背景混合,生成不可辨认、逼真的视频帧。全面实验表明,GGTalker在渲染质量、3D一致性、唇同步准确性和训练效率方面均实现了最新的性能。
引用
@article{arxiv.2506.21513,
title = {GGTalker: Talking Head Systhesis with Generalizable Gaussian Priors and Identity-Specific Adaptation},
author = {Wentao Hu and Shunkai Li and Ziqiao Peng and Haoxian Zhang and Fan Shi and Xiaoqiang Liu and Pengfei Wan and Di Zhang and Hui Tian},
journal= {arXiv preprint arXiv:2506.21513},
year = {2025}
}
备注
ICCV 2025, Project page: https://vincenthu19.github.io/GGTalker/