EmoFace:面向情感的音频驱动 3D 人脸动画
计算机视觉与模式识别
2024-08-06 v1 图形学
摘要
音频驱动情感 3D 人脸动画旨在生成带有情感表达且口型与语音同步的虚拟形象。然而,先前研究常忽视情感对面部表情的影响,或不适用于驱动 MetaHuman 模型。为此,我们引入 EmoFace,一种新型音频驱动方法,用于创建具有丰富情感动态的面部动画。我们的 approach 能够生成多种情感表达,具备生成随机且自然眨眼和眼动的能力,同时保持精准的口型同步。我们提出独立的语音编码器和情感编码器,用于学习音频、情感与相应面部控制 rigs 之间的关系,最终映射到控制值序列。此外,我们引入两种后处理技术,专注于提升动画的真实性,尤其在眨眼和眼动方面。鉴于情感音视频数据稀缺且不适用于 MetaHuman 模型,我们贡献了一个情感音视频数据集并为每帧推导控制参数。我们的方法可用于生成视频游戏中非玩家角色(NPCs)的对话动画,以及驱动虚拟现实环境中的头像。我们的进一步定量和定性实验,以及与现有研究的对用户研究,表明该方法在驱动 3D 人脸模型方面表现优异。代码和示例数据已置于 https://github.com/SJTU-Lucy/EmoFace。
引用
@article{arxiv.2407.12501,
title = {EmoFace: Audio-driven Emotional 3D Face Animation},
author = {Chang Liu and Qunfen Lin and Zijiao Zeng and Ye Pan},
journal= {arXiv preprint arXiv:2407.12501},
year = {2024}
}
备注
2024 IEEE Conference Virtual Reality and 3D User Interfaces (VR). IEEE, 2024