中文

基于内容-情感解耦的情感语音驱动动画

计算机视觉与模式识别 2023-09-27 v2 图形学

摘要

若要被广泛采用,3D 面部虚拟形象必须能够轻松、逼真且直接由语音信号驱动动画。尽管近期最佳方法生成的 3D 动画与输入音频同步,但它们很大程度上忽略了情感对面部表情的影响。逼真的面部动画需要口型同步与自然情感表达并重。为此,我们提出 EMOTE(面向情感对话优化的表达模型),其生成的 3D 说话头虚拟形象在保持语音口型同步的同时,可对情感表达进行显式控制。为此,我们以解耦的损失对 EMOTE 进行语音(即口型同步)与情感监督。这些损失基于两个关键观察:(1) 语音引起的面部形变在空间上局限于嘴部周围且时间频率高,而 (2) 面部表情可形变整个面部且发生于较长间隔。因此,我们以逐帧唇读损失训练 EMOTE 以保留语音相关内容,同时在序列层级监督情感。此外,我们采用内容-情感交换机制,以在同一音频上监督不同情感,同时保持唇部运动与语音同步。为使用深度感知损失而不产生不良伪影,我们设计了一种时序 VAE 形式的人运动先验。由于缺乏高质量的带语音对齐情感 3D 人脸数据集,EMOTE 使用从情感视频数据集(即 MEAD)提取的 3D 伪真值训练。大量定性与感知评估表明,EMOTE 生成的语音驱动面部动画口型同步优于在相同数据上训练的 SOTA 方法,同时提供额外的优质情感控制。

关键词

引用

@article{arxiv.2306.08990,
  title  = {Emotional Speech-Driven Animation with Content-Emotion Disentanglement},
  author = {Radek Daněček and Kiran Chhatre and Shashank Tripathi and Yandong Wen and Michael J. Black and Timo Bolkart},
  journal= {arXiv preprint arXiv:2306.08990},
  year   = {2023}
}

备注

SIGGRAPH Asia 2023 Conference Paper