中文

基于高斯点云的情感感知话术头部合成

计算机视觉与模式识别 2026-03-31 v2

摘要

音频驱动的 3D 话术头部合成技术近年来在神经辐射场 (NeRF) 和 3D 高斯点云 (3DGS) 方面取得了快速进展。通过利用丰富的预训练先验,few-shot 方法能够从仅几秒的视频中实现即时个性化。然而,在富有表情的面部动作下,现有的 few-shot 方法常常出现几何不稳定和音频-情感不匹配的问题,凸显了需要更有效的情感感知运动建模。本文提出了 EmoTaG,一个建立在 Pretrain-and-Adapt 范式下的 few-shot 情感感知 3D 话术头部合成框架。我们的关键洞察是将运动预测在结构化的 FLAME 参数空间中进行,而非直接变形 3D 高斯点,这引入了显式的几何先验以提高运动稳定性。基于此,我们提出了 Gated Residual Motion Network (GRMN),它从音频中捕获情感韵律,同时补充音频中缺失的头部姿态和上半脸线索,实现富有表现力且连贯的运动生成。大量实验表明,EmoTaG 在情感表达性、唇部同步、视觉真实性和运动稳定性方面实现了最先进的性能。

关键词

引用

@article{arxiv.2603.21332,
  title  = {EmoTaG: Emotion-Aware Talking Head Synthesis on Gaussian Splatting with Few-Shot Personalization},
  author = {Haolan Xu and Keli Cheng and Lei Wang and Ning Bi and Xiaoming Liu},
  journal= {arXiv preprint arXiv:2603.21332},
  year   = {2026}
}

备注

Accepted by CVPR 2026. Page: https://emotag26.github.io/