基于3D高斯溅射的像素感知密度控制实现实时音频驱动说话人头生成
声音
2025-09-23 v1 人工智能
图像与视频处理
摘要
音频驱动的说话人头生成对于虚拟现实、数字化身和电影制作等应用至关重要。虽然基于NeRF的方法能够实现高保真重建,但存在渲染效率低和音画同步不佳的问题。本工作提出PGSTalker,一个基于3D高斯溅射(3DGS)的实时音频驱动说话人头合成框架。为提高渲染性能,我们提出了像素感知密度控制策略,通过自适应分配点密度,在动态面部区域增强细节,同时减少其他区域的冗余。此外,我们引入了轻量级多模态门控融合模块,有效融合音频和空间特征,从而提高高斯变形预测的准确性。在公开数据集上的大量实验表明,PGSTalker在渲染质量、唇同步精度和推理速度方面均优于现有的基于NeRF和3DGS的方法。该方法表现出强大的泛化能力和实际部署潜力。
引用
@article{arxiv.2509.16922,
title = {PGSTalker: Real-Time Audio-Driven Talking Head Generation via 3D Gaussian Splatting with Pixel-Aware Density Control},
author = {Tianheng Zhu and Yinfeng Yu and Liejun Wang and Fuchun Sun and Wendong Zheng},
journal= {arXiv preprint arXiv:2509.16922},
year = {2025}
}
备注
Main paper (15 pages). Accepted for publication by ICONIP( International Conference on Neural Information Processing) 2025