用于语音驱动面部动画的多样化代码查询学习
计算机视觉与模式识别
2024-10-01 v1
摘要
语音驱动面部动画旨在根据给定的语音信号合成唇形同步的 3D 说话人脸。该任务的先前方法大多侧重于通过确定性系统追求真实感,但迄今为止很少研究面部运动潜在的随机性特征。虽然生成式建模方法可以通过重复采样轻松处理一对多映射,但在小规模数据集上确保覆盖合理面部运动的多样化模式仍然具有挑战性且较少被探索。在本文中,我们提出预测以相同音频信号为条件的多个样本,然后明确鼓励样本多样性,以解决多样化面部动画合成问题。我们的核心洞察是引导我们的模型利用促进多样性的损失来探索富有表现力的面部潜空间,从而理想地识别用于多样化的所需潜码。为此,在通过向量量化变分自编码机制学习到的丰富面部先验的基础上,我们的模型在时间上查询多个随机码,这些码可以灵活地解码为一组多样且合理且忠于语音的面部运动。为了进一步允许在生成过程中控制不同的面部部分,所提出的模型被设计为以顺序方式预测感兴趣的不同面部部分,并将它们组合以最终形成全脸运动。我们的范式在统一公式中实现了多样且可控的面部动画合成。我们在实验上证明,我们的方法在定量和定性上均取得了最先进的性能,尤其是在样本多样性方面。
引用
@article{arxiv.2409.19143,
title = {Diverse Code Query Learning for Speech-Driven Facial Animation},
author = {Chunzhi Gu and Shigeru Kuriyama and Katsuya Hotta},
journal= {arXiv preprint arXiv:2409.19143},
year = {2024}
}