ProbTalk3D:基于 VQ-VAE 的非确定性情感可控语音驱动 3D 面部动画合成
计算机视觉与模式识别
2025-02-18 v4 人工智能
摘要
音频驱动的 3D 面部动画合成一直是一个活跃的研究领域,受到学术界和工业界的广泛关注。尽管该领域取得了可喜的成果,但近期方法主要关注唇形同步和身份控制,忽略了情感及情感控制在生成过程中的作用。这主要是由于缺乏情感丰富的面部动画数据,以及能够同时合成带有情感表达的语音动画的算法。此外,大多数模型是确定性的,即给定相同的音频输入,它们会产生相同的输出动作。我们认为,情感和非确定性对于生成多样且情感丰富的面部动画至关重要。在本文中,我们提出 ProbTalk3D,一种使用两阶段 VQ-VAE 模型和情感丰富的面部动画数据集 3DMEAD 的非确定性神经网络方法,用于情感可控的语音驱动 3D 面部动画合成。我们通过客观评估、定性评估以及感知用户研究,将我们的模型与近期 3D 面部动画合成方法进行了广泛的比较分析。我们强调了几种更适合评估随机输出的客观指标,并在主观评估中使用了自然场景数据和真实数据。据我们所知,这是首个结合丰富情感数据集以及带有情感标签和强度级别的情感控制的非确定性 3D 面部动画合成方法。我们的评估表明,与最先进的情感控制模型、确定性模型和非确定性模型相比,所提出的模型取得了更优的性能。我们建议观看补充视频以进行质量评判。完整代码库已公开 (https://github.com/uuembodiedsocialai/ProbTalk3D/)。
引用
@article{arxiv.2409.07966,
title = {ProbTalk3D: Non-Deterministic Emotion Controllable Speech-Driven 3D Facial Animation Synthesis Using VQ-VAE},
author = {Sichun Wu and Kazi Injamamul Haque and Zerrin Yumak},
journal= {arXiv preprint arXiv:2409.07966},
year = {2025}
}
备注
14 pages, 9 figures, 3 tables. Includes code. Accepted at ACM SIGGRAPH MIG 2024