SAiD:基于扩散模型的语音驱动混合变形面部动画
计算机视觉与模式识别
2024-01-26 v2 人工智能
图形学
机器学习
多媒体
摘要
尽管已有广泛研究,但由于大规模视觉-音频数据集的稀缺,语音驱动的3D面部动画仍具挑战性。大多数先前工作通常专注于在小数据集上使用最小二乘法学习回归模型,这导致难以从语音生成多样化的唇部运动,并且需要大量精力来细化生成结果。为解决这些问题,我们提出了一种基于扩散模型的语音驱动3D面部动画方法(Speech-driven 3D facial animation with a diffusion model, SAiD),这是一个轻量级的基于Transformer的U-Net,具有音频与视觉之间的跨模态对齐偏置以增强唇音同步。此外,我们引入了BlendVOCA,一个包含语音音频与混合变形面部模型参数对的基准数据集,以解决公共资源的稀缺问题。我们的实验结果表明,所提出的方法在唇音同步方面达到了与基线相当或更优的性能,确保了更多样化的唇部运动,并简化了动画编辑流程。
引用
@article{arxiv.2401.08655,
title = {SAiD: Speech-driven Blendshape Facial Animation with Diffusion},
author = {Inkyu Park and Jaewoong Cho},
journal= {arXiv preprint arXiv:2401.08655},
year = {2024}
}
备注
Fix bug related to the font size