中文

UniTalker:通过统一模型扩展音频驱动的三维面部动画

计算机视觉与模式识别 2024-08-02 v1

摘要

音频驱动的三维面部动画旨在将输入音频映射到真实的面部运动。尽管取得了显著进展,但由于三维标注的不一致性,之前的模型仅限于在特定标注上训练,从而限制了训练规模。在这项工作中,我们提出了 UniTalker,一个具有多头架构的统一模型,旨在有效利用具有不同标注的数据集。为了增强训练稳定性并确保多头输出之间的一致性,我们采用了三种训练策略,即主成分分析(PCA)、模型预热和枢纽身份嵌入。为了扩大训练规模和多样性,我们组装了 A2F-Bench,涵盖五个公开可用的数据集和三个新策划的数据集。这些数据集包含广泛的音频领域,涵盖多语言语音和歌曲,从而将训练数据从通常使用的不到 1 小时的数据集扩展到 18.5 小时。通过单个训练好的 UniTalker 模型,我们在 BIWI 数据集上实现了 9.2% 的唇顶点误差减少,在 Vocaset 上实现了 13.7% 的减少。此外,预训练的 UniTalker 作为音频驱动面部动画任务的基础模型展现出前景。在已见数据集上微调预训练的 UniTalker 进一步提升了每个数据集的性能,在 A2F-Bench 上的平均误差减少为 6.3%。此外,仅使用一半数据在未见数据集上微调 UniTalker 的表现超过了在完整数据集上训练先前最先进模型的性能。代码和数据集可在项目页面 https://github.com/X-niper/UniTalker 获取。

关键词

引用

@article{arxiv.2408.00762,
  title  = {UniTalker: Scaling up Audio-Driven 3D Facial Animation through A Unified Model},
  author = {Xiangyu Fan and Jiaqi Li and Zhiqian Lin and Weiye Xiao and Lei Yang},
  journal= {arXiv preprint arXiv:2408.00762},
  year   = {2024}
}