中文

3D 语音头生成中的精细面部控制

计算机视觉与模式识别 2026-02-11 v1

摘要

音频驱动的语音头生成是数字化身的核心组件,3D 高斯溅写在实时渲染高保真语音头方面显示出强大的性能。然而,实现对精细面部运动的精确控制仍是一个重大挑战,尤其是由于唇部同步不准确和面部抖动,这两者都可能导致不安感。为此,我们提出了精细 3D 高斯溅写 (FG-3DGS),一个新框架,使语音头生成具有时序一致性和高保真。我们的方法引入了基于运动特征的面部区域显式建模的频率感知解耦策略。低频区域,如面颊、鼻子和前额,使用标准 MLP 联合建模;而高频区域,包括眼睛和嘴唇,则使用由面部区域掩码引导的专用网络单独捕获。表示为高斯增量的预测运动动力学被应用于静态高斯,以生成最终的头部帧,通过使用帧特定摄像机参数的光栅化器进行渲染。此外,我们还包括一个由大规模音视频对由预训练模型学习的高频细化后渲染对齐机制,以增强单帧生成并实现更准确的唇部同步。广泛用于语音头生成的数据集上的大量实验表明,该方法在 producing 高保真、同步语音头视频方面优于最近的 SOTA 方法。

关键词

引用

@article{arxiv.2602.09736,
  title  = {Toward Fine-Grained Facial Control in 3D Talking Head Generation},
  author = {Shaoyang Xie and Xiaofeng Cong and Baosheng Yu and Zhipeng Gui and Jie Gui and Yuan Yan Tang and James Tin-Yau Kwok},
  journal= {arXiv preprint arXiv:2602.09736},
  year   = {2026}
}