中文

情感对话:实现说话面部表情、注视和姿态的协调表达

计算机视觉与模式识别 2024-06-13 v1

摘要

逼真的说话面部生成在电影和游戏制作等多样化多媒体领域具有巨大的潜在应用价值。虽然现有方法能够准确地将唇部动作与输入音频同步,但通常忽略情感与面部线索之间的关键一致性,包括表情、注视和头部姿态。这种一致性对于合成真实视频至关重要。为此,我们提出了一个采用3D面部关键点作为中间变量的两阶段音频驱动说话面部生成框架。该框架通过自监督学习实现表情、注视和姿态与情感的协调一致。具体而言,我们将该任务分解为两个关键步骤,即语音到关键点的合成和关键点到面部生成。第一步 focuses on 同时合成情感对齐的面部线索,包括表示表情、注视和头部姿态的归一化关键点。这些线索随后被重新组装成移动后的面部关键点。在第二步中,这些移动后的关键点被映射到潜在关键点上,并通过自监督学习输入到预训练模型中以创建高质量的人脸图像。在MEAD数据集上的大量实验表明,我们的模型在视觉质量和情感对齐方面显著优于当前最先进的性能。

关键词

引用

@article{arxiv.2406.07895,
  title  = {Emotional Conversation: Empowering Talking Faces with Cohesive Expression, Gaze and Pose Generation},
  author = {Jiadong Liang and Feng Lu},
  journal= {arXiv preprint arXiv:2406.07895},
  year   = {2024}
}