Mimic:语音驱动 3D 面部动画中的说话风格解耦
计算机视觉与模式识别
2023-12-19 v1
摘要
语音驱动的 3D 面部动画旨在合成生动的面部动画,使其与语音精确同步并匹配独特的说话风格。然而,现有工作主要侧重于实现精确的唇部同步,而忽略了对特定主体说话风格的建模,往往导致不真实的面部动画。据我们所知,这项工作首次尝试探索面部动作中说话风格与语义内容之间的耦合信息。具体而言,我们引入了一种创新的说话风格解耦方法,该方法能够进行任意主体的说话风格编码,从而实现更真实的语音驱动面部动画合成。随后,我们提出了一个名为 \textbf{Mimic} 的新框架,通过分别为风格和内容构建两个潜在空间,从面部动作中学习说话风格和内容的解耦表示。此外,为了促进解耦表示学习,我们引入了四个精心设计的约束:一个辅助风格分类器、一个辅助逆分类器、一个内容对比损失和一对潜在循环损失,这些约束能够有效促进与身份相关的风格空间和与语义相关的内容空间的构建。在三个公开可用数据集上进行的大量定性和定量实验表明,我们的方法优于 SOTA 方法,并且能够为语音驱动的 3D 面部动画捕捉多样的说话风格。源代码和补充视频公开于:https://zeqing-wang.github.io/Mimic/
引用
@article{arxiv.2312.10877,
title = {Mimic: Speaking Style Disentanglement for Speech-Driven 3D Facial Animation},
author = {Hui Fu and Zeqing Wang and Ke Gong and Keze Wang and Tianshui Chen and Haojie Li and Haifeng Zeng and Wenxiong Kang},
journal= {arXiv preprint arXiv:2312.10877},
year = {2023}
}
备注
7 pages, 6 figures, accepted by AAAI-24