中文

从语音中学习关键点运动以生成说话人无关的 3D 说话头

计算机视觉与模式识别 2023-07-27 v2

摘要

本文提出了一种从原始音频输入生成 3D 说话头的新方法。我们的方法基于如下思想:与语音相关的运动可以通过位于面部可动部位(即关键点)的少数控制点的运动来全面且高效地描述。其底层肌骨结构使我们能够学习这些关键点的运动如何影响整个面部的几何形变。所提方法为此采用两个不同模型:第一个模型从给定音频学习生成稀疏关键点集合的运动;第二个模型将此类关键点运动扩展为稠密运动场,用于驱动处于中性状态的给定 3D 网格。此外,我们引入了一种称为余弦损失(Cosine Loss)的新损失函数,其最小化生成运动向量与真实运动向量之间的夹角。在 3D 说话头生成中使用关键点具有一致性、可靠性以及无需手动标注等优势。我们的方法设计为身份无关(identity-agnostic),能够为任何用户生成高质量面部动画而无需额外数据或训练。

关键词

引用

@article{arxiv.2306.01415,
  title  = {Learning Landmarks Motion from Speech for Speaker-Agnostic 3D Talking Heads Generation},
  author = {Federico Nocentini and Claudio Ferrari and Stefano Berretti},
  journal= {arXiv preprint arXiv:2306.01415},
  year   = {2023}
}