中文

具有可控情感的表现性语音驱动面部动画

计算机视觉与模式识别 2025-05-08 v2

摘要

生成高真实感的面部动画需求极高,但这仍是一项具有挑战性的任务。现有的语音驱动面部动画方法能产生令人满意的嘴部运动和唇形同步,但在戏剧性情感表达和情感控制的灵活性方面表现薄弱。本文提出一种新颖的基于深度学习的方法,用于从语音生成表现性面部动画,能够展现广谱面部表情并可控情感类型与强度。我们提出一个情感控制器模块,以学习情感变化(如类型和强度)与相应面部表情参数之间的关系。它实现了情感可控的面部动画,其中目标表情可按需连续调节。定性与定量评估表明,我们的方法生成的动画富含面部情感表现力,同时保留准确的唇部运动,优于其他最先进的方法。

关键词

引用

@article{arxiv.2301.02008,
  title  = {Expressive Speech-driven Facial Animation with controllable emotions},
  author = {Yutong Chen and Junhong Zhao and Wei-Qiang Zhang},
  journal= {arXiv preprint arXiv:2301.02008},
  year   = {2025}
}