中文

EmoDiffTalk:基于情感感知扩散的可编辑3D高斯说话人

计算机视觉与模式识别 2025-12-12 v2

摘要

近期基于3D高斯渲染的逼真3D说话人仍在情感表达操控方面存在显著不足,尤其是针对多模态控制下的细粒度和广泛动态情感编辑。本文引入一种新的可编辑3D高斯说话人,即EmoDiffTalk。我们的核心思想是一种新颖的情感感知高斯扩散,包括基于动作单元(Action Unit, AU)的提示驱动高斯扩散过程,用于细粒度面部动画;同时引入精准的文本到AU情感控制器,实现通过文本输入进行准确且广泛的动态情感编辑。在公开的EmoTalk3D和RenderMe-360数据集上进行实验,表明EmoDiffTalk在情感细腻度、唇音同步保真度和可控性方面优于先前工作,为向高质量、基于扩散的、多模态可编辑3D说话人合成 establish 了原则性路径。据我们了解,EmoDiffTalk是目前少数几款支持连续、多模态情感编辑的3D高斯渲染说话人生成框架,尤其擅长在基于AU的表情空间内实现情感编辑。

关键词

引用

@article{arxiv.2512.05991,
  title  = {EmoDiffTalk:Emotion-aware Diffusion for Editable 3D Gaussian Talking Head},
  author = {Chang Liu and Tianjiao Jing and Chengcheng Ma and Xuanqi Zhou and Zhengxuan Lian and Qin Jin and Hongliang Yuan and Shi-Sheng Huang},
  journal= {arXiv preprint arXiv:2512.05991},
  year   = {2025}
}