SEDTalker:基于帧级语音情感辨识的情感感知 3D 面部动画
计算机视觉与模式识别
2026-04-16 v1
摘要
我们提出 SEDTalker,一个情感感知的语音驱动 3D 面部动画框架,利用帧级语音情感辨识实现细粒度的表达控制。不同于以前的方法依赖句子级或人工指定情感标签,本方法直接从语音中预测时序稠密的情感类别与强度,实现情感表达在时间上的连续调制。所辨识的情感信号被编码为学习型嵌入,用于条件化语音驱动 3D 动画模型。该模型基于混合 Transformer-Mamba 架构构建,有效实现语言内容与情感风格的解耦,同时保持身份特征与时序一致性。我们在大规模多语料库数据集上评估情感辨识性能,并在 EmoVOCA 数据集上进行情感 3D 面部动画任务测试。定量结果表明,本方法在帧级情感识别方面表现优异,几何与时序重建误差均较低;定性结果显示情感过渡平滑且表达控制一致。这些发现凸显了帧级情感辨识在实现情感化且可控的 3D 说话人生成中的有效性。
引用
@article{arxiv.2604.13335,
title = {SEDTalker: Emotion-Aware 3D Facial Animation Using Frame-Level Speech Emotion Diarization},
author = {Farzaneh Jafari and Stefano Berretti and Anup Basu},
journal= {arXiv preprint arXiv:2604.13335},
year = {2026}
}
备注
15 pages; 4 figures; conference