中文

EGSTalker:基于 3D 高斯溅写的实时音频驱动说话人头生成

声音 2025-10-13 v1 人工智能 音频与语音处理

摘要

本文提出 EGSTalker,一个基于 3D 高斯溅写(3DGS)的实时音频驱动说话人头生成框架。旨在提升渲染速度和视觉保真度,EGSTalker 只需 3-5 分钟训练视频即可合成高质量面部动画。框架包含两个关键阶段:静态高斯初始化和音频驱动变形。在第一阶段,使用多分辨率哈希三平面和Kolmogorov-Arnold Network(KAN)提取空间特征并构建紧凑的 3D 高斯表示。在第二阶段,我们提出一种高效空间-音频注意(ESAA)模块融合音频与空间线索,KAN 预测相应的高斯变形。大量实验表明,EGSTalker 在渲染质量和唇同步精度方面与最先进的方法持平,同时在推理速度上显著领先。结果凸显了 EGSTalker 在实时多媒体应用中的潜力。

关键词

引用

@article{arxiv.2510.08587,
  title  = {EGSTalker: Real-Time Audio-Driven Talking Head Generation with Efficient Gaussian Deformation},
  author = {Tianheng Zhu and Yinfeng Yu and Liejun Wang and Fuchun Sun and Wendong Zheng},
  journal= {arXiv preprint arXiv:2510.08587},
  year   = {2025}
}

备注

Main paper (6 pages). Accepted for publication by IEEE International Conference on Systems, Man, and Cybernetics 2025