中文

GaussianTalker:基于 3D 高斯溅写的演讲者特定 talking head 合成

计算机视觉与模式识别 2024-08-12 v3 多媒体

摘要

最近的基于神经辐射场 (NeRF) 的音频驱动 talking head 合成研究取得了令人瞩目的成果。然而,由于 NeRF 隐式表示导致的姿态和表情控制不足,这些方法仍存在一些局限性,如 lip 动作不同步或不自然,以及视觉抖动和伪影。本文提出了 GaussianTalker,这是一种基于 3D 高斯溅写的音频驱动 talking head 合成新方法。凭借 3D 高斯的显式表示特性,通过将高斯绑定到 3D 脸部模型,实现了对脸部运动的直观控制。GaussianTalker 包含两个模块:演讲者特定运动译者 和 动态高斯渲染器。演讲者特定运动译者通过通用化的音频特征提取和定制化的 lip 动作生成,实现对目标演讲者精确的 lip 动作。动态高斯渲染器引入演讲者特定 BlendShapes,通过潜在姿态增强面部细节表现,实现稳定且逼真的渲染视频。大量实验结果表明,GaussianTalker 在 talking head 合成中优于现有最先进方法,实现了精准的 lip 同步和卓越的视觉质量。本方法在 NVIDIA RTX4090 GPU 上实现了 130 FPS 的渲染速度,显著超过实时渲染性能阈值, potentially 可部署于其他硬件平台。

关键词

引用

@article{arxiv.2404.14037,
  title  = {GaussianTalker: Speaker-specific Talking Head Synthesis via 3D Gaussian Splatting},
  author = {Hongyun Yu and Zhan Qu and Qihang Yu and Jianchuan Chen and Zhonghua Jiang and Zhiwen Chen and Shengyu Zhang and Jimin Xu and Fei Wu and Chengfei Lv and Gang Yu},
  journal= {arXiv preprint arXiv:2404.14037},
  year   = {2024}
}

备注

Accepted by ACM MM 2024. Project page: https://yuhongyun777.github.io/GaussianTalker/