GaussianTalker:基于音频驱动的3D高斯泼溅的实时高保真说话头合成
计算机视觉与模式识别
2024-04-26 v2 多媒体
摘要
我们提出GaussianTalker,一个用于实时生成姿态可控说话头的新颖框架。它利用3D高斯泼溅的快速渲染能力,同时解决了用语音音频直接控制3DGS的挑战。GaussianTalker构建头部的规范3DGS表示,并使其与音频同步变形。一个关键见解是将3D高斯属性编码到共享的隐式特征表示中,并与音频特征合并以操纵每个高斯属性。这种设计利用了空间感知特征并加强了相邻点之间的交互。然后,特征嵌入被馈送到空间-音频注意力模块,该模块预测每个高斯属性的逐帧偏移。与之前用于操纵大量高斯及其复杂参数的拼接或乘法方法相比,这种方法更稳定。实验结果表明,与之前的方法相比,GaussianTalker在面部保真度、唇形同步准确性和渲染速度方面具有优越性。具体来说,GaussianTalker实现了高达120 FPS的显著渲染速度,超过了之前的基准。我们的代码可在https://github.com/KU-CVLAB/GaussianTalker/获取。
引用
@article{arxiv.2404.16012,
title = {GaussianTalker: Real-Time High-Fidelity Talking Head Synthesis with Audio-Driven 3D Gaussian Splatting},
author = {Kyusun Cho and Joungbin Lee and Heeji Yoon and Yeobin Hong and Jaehoon Ko and Sangjun Ahn and Seungryong Kim},
journal= {arXiv preprint arXiv:2404.16012},
year = {2024}
}
备注
Project Page: https://ku-cvlab.github.io/GaussianTalker