中文

基于可变高斯溅射的实时音频驱动说话面脸生成

计算机视觉与模式识别 2024-05-01 v1

摘要

我们提出 GStalker,一个基于高斯溅射 (Gaussian Splatting) 的 3D 音频驱动说话面脸生成模型,实现快速训练 (40 分钟) 和实时渲染 (125 FPS),训练材料为 3~5 分钟的视频,与以往基于 2D 和 3D NeRF 的建模框架相比,训练时间为数小时,渲染速度为每帧数秒。具体而言,GStalker 学习一个音频驱动的高斯变形场,将 3D 高斯变形以同步音频信息,其中包含基于多分辨率哈希网格的三平面和时间平滑模块,用于学习细粒度面部细节的精确变形。此外,设计了一个以姿态为条件的变形场,用于建模稳定的躯干。为有效优化该条件高斯变形场,我们通过学习粗糙的静态高斯表示来初始化 3D 高斯。广泛的在 person-specific 视频中包含音频轨迹的实验验证了 GStalker 能够以快速训练和实时渲染速度生成高保真且音频-唇部同步的结果。

关键词

引用

@article{arxiv.2404.19040,
  title  = {GSTalker: Real-time Audio-Driven Talking Face Generation via Deformable Gaussian Splatting},
  author = {Bo Chen and Shoukang Hu and Qi Chen and Chenpeng Du and Ran Yi and Yanmin Qian and Xie Chen},
  journal= {arXiv preprint arXiv:2404.19040},
  year   = {2024}
}