GaussianHeadTalk:基于音频驱动 Gaussian Splatting 的无抖动 3D 说话头
计算机视觉与模式识别
2025-12-12 v1
摘要
语音驱动的说话头近期已经出现,并实现了交互式虚拟形象。然而,实际应用受到限制,因为现有方法要么具有高视觉保真度但速度慢,要么速度快但时间上不稳定。扩散方法提供了逼真的图像生成,但在单次设置中表现困难。Gaussian Splatting 方法是实时的,但面部跟踪的不准确或 Gaussian 映射的不一致会导致不稳定输出和视频伪影,不利于真实应用场景。我们通过使用 3D Morphable Models 映射 Gaussian Splatting 来生成特定人物的虚拟形象,从而解决了这一问题。我们引入了基于 transformer 的模型参数预测,直接从音频驱动以实现时间一致性。从单目视频和独立音频语音输入出发,我们的方法实现了实时说话头视频生成,并在定量和定性性能上达到了竞争水平。
引用
@article{arxiv.2512.10939,
title = {GaussianHeadTalk: Wobble-Free 3D Talking Heads with Audio Driven Gaussian Splatting},
author = {Madhav Agarwal and Mingtian Zhang and Laura Sevilla-Lara and Steven McDonagh},
journal= {arXiv preprint arXiv:2512.10939},
year = {2025}
}
备注
IEEE/CVF Winter Conference on Applications of Computer Vision 2026