中文

基于情感先验蒸馏的不确定性感知三维情感说话人脸合成

人工智能 2026-01-28 v1 多媒体 声音

摘要

情感说话人脸合成是多媒体和信号处理中的关键任务,但现有三维方法面临两个核心挑战:音频-视觉情感对齐不佳,表现为难以提取音频情感和对情感微表情控制不足;以及一种通用的多视图融合策略忽略了不确定性和特征质量差异,导致渲染质量受损。我们提出了 UA-3DTalk,一种采用情感先验蒸馏的不确定性感知三维情感说话人脸合成方法,其包含三个核心模块:先验提取模块将音频分解为内容同步特征用于对齐和人物特定互补特征用于个性化;情感蒸馏模块引入多模态注意力加权融合机制和 4D 高斯编码,采用多分辨率词典,实现细粒度音频情感提取和精确的情感微表情控制;不确定性变形模块部署不确定性块来估计视图特定的 aleatoric(输入噪声)和 epistemic(模型参数)不确定性,实现自适应多视图融合,并采用多头解码器进行高斯原始对象的优化,以缓解均匀权重融合的局限性。在常规数据集和情感数据集上的大量实验表明,UA-3DTalk 在情感对齐方面比 DEGSTalk 和 EDTalk 提高了 5.2% 的 E-FID,在同步率上提高了 3.1% 的 SyncC,在渲染质量上提高了 0.015 的 LPIPS。项目页面: https://mrask999.github.io/UA-3DTalk

关键词

引用

@article{arxiv.2601.19112,
  title  = {Uncertainty-Aware 3D Emotional Talking Face Synthesis with Emotion Prior Distillation},
  author = {Nanhan Shen and Zhilei Liu},
  journal= {arXiv preprint arXiv:2601.19112},
  year   = {2026}
}

备注

Accepted by ICASSP 2026