中文

MemoryTalker:基于音频引导的个人化 3D 人脸动画

计算机视觉与模式识别 2025-08-26 v2 人工智能

摘要

语音驱动的 3D 人脸动画旨在从给定音频合成逼真的人脸动作序列,匹配说话者的说话风格。然而,前述方法通常需要说话者类别标签或额外的 3D 人脸网格等先验信息,以致无法反映说话风格并限制其实际应用。为此,我们提出了 MemoryTalker,通过仅使用音频输入即可实现逼真且准确的 3D 人脸运动合成,以最大化其在实际应用中的可用性。我们的框架包含两个训练阶段:第一个阶段存储和检索通用运动(即记忆),第二个阶段仅使用存储的运动进行个人化人脸运动合成(即动画),并通过音频驱动的说话风格特征对其进行风格化。在第二个阶段,我们的模型学习了针对特定音频应突出显示哪些人脸运动类型。结果表明,MemoryTalker 可在无需额外先验信息的情况下生成可靠的个人化人脸动画。通过定量和定性评估以及用户研究,我们展示了该模型在个人化人脸动画方面的有效性及其相对于最新方法的性能提升。

关键词

引用

@article{arxiv.2507.20562,
  title  = {MemoryTalker: Personalized Speech-Driven 3D Facial Animation via Audio-Guided Stylization},
  author = {Hyung Kyu Kim and Sangmin Lee and Hak Gu Kim},
  journal= {arXiv preprint arXiv:2507.20562},
  year   = {2025}
}

备注

Accepted in ICCV 2025; Project Page: https://cau-irislab.github.io/ICCV25-MemoryTalker/