EGSTalker:基于 3D 高斯溅写的实时音频驱动说话人头生成
声音
2025-10-13 v1 人工智能
音频与语音处理
摘要
本文提出 EGSTalker,一个基于 3D 高斯溅写(3DGS)的实时音频驱动说话人头生成框架。旨在提升渲染速度和视觉保真度,EGSTalker 只需 3-5 分钟训练视频即可合成高质量面部动画。框架包含两个关键阶段:静态高斯初始化和音频驱动变形。在第一阶段,使用多分辨率哈希三平面和Kolmogorov-Arnold Network(KAN)提取空间特征并构建紧凑的 3D 高斯表示。在第二阶段,我们提出一种高效空间-音频注意(ESAA)模块融合音频与空间线索,KAN 预测相应的高斯变形。大量实验表明,EGSTalker 在渲染质量和唇同步精度方面与最先进的方法持平,同时在推理速度上显著领先。结果凸显了 EGSTalker 在实时多媒体应用中的潜力。
引用
@article{arxiv.2510.08587,
title = {EGSTalker: Real-Time Audio-Driven Talking Head Generation with Efficient Gaussian Deformation},
author = {Tianheng Zhu and Yinfeng Yu and Liejun Wang and Fuchun Sun and Wendong Zheng},
journal= {arXiv preprint arXiv:2510.08587},
year = {2025}
}
备注
Main paper (6 pages). Accepted for publication by IEEE International Conference on Systems, Man, and Cybernetics 2025