CSTalk:相关性监督的语音驱动 3D 情感面部动画生成
计算机视觉与模式识别
2024-04-30 v1 人工智能
摘要
语音驱动的 3D 面部动画技术已发展多年,但其实际应用仍不及预期。主要挑战在于数据限制、嘴唇对齐以及面部表情的自然度。尽管嘴唇对齐已有许多相关研究,但现有方法难以合成自然逼真的表情,导致面部动画显得机械僵硬。即使有一些研究从语音中提取情感特征,面部运动的随机性也限制了情感的有效表达。为解决这一问题,本文提出了一种名为 CSTalk(Correlation Supervised)的方法,该方法对面部运动不同区域之间的相关性进行建模,并监督生成模型的训练,以生成符合人类面部运动模式的逼真表情。为了生成更精细的动画,我们基于 Metahuman 角色模型采用了丰富的控制参数集,并采集了包含五种不同情感的数据集。我们使用自编码器结构训练生成网络,并输入情感嵌入向量以实现用户可控表情的生成。实验结果表明,我们的方法优于现有的 SOTA 方法。
引用
@article{arxiv.2404.18604,
title = {CSTalk: Correlation Supervised Speech-driven 3D Emotional Facial Animation Generation},
author = {Xiangyu Liang and Wenlin Zhuang and Tianyong Wang and Guangxing Geng and Guangyue Geng and Haifeng Xia and Siyu Xia},
journal= {arXiv preprint arXiv:2404.18604},
year = {2024}
}