中文

PESTalk:基于语音的带个性化情感风格的 3D 脸部动画

图形学 2025-12-08 v1 人工智能

摘要

PESTalk 是一种一种新型方法,可直接从语音生成带有个性化情感风格的 3D 脸部动画。它通过引入捕获时间域和频域音频特征的双流情感提取器(DSEE),实现对情绪的精细分析;并引入情感风格建模模块(ESMM),基于声纹特征建模个体表达模式。为解决数据稀缺问题,该方法利用新构建的 3D-EmoStyle 数据集。评估结果表明,PESTalk 在生成真实且个性化的脸部动画方面优于当前流行的方法。

关键词

引用

@article{arxiv.2512.05121,
  title  = {PESTalk: Speech-Driven 3D Facial Animation with Personalized Emotional Styles},
  author = {Tianshun Han and Benjia Zhou and Ajian Liu and Yanyan Liang and Du Zhang and Zhen Lei and Jun Wan},
  journal= {arXiv preprint arXiv:2512.05121},
  year   = {2025}
}