面向语音驱动 3D 头部动画的 ARTalk:自回归模型
计算机视觉与模式识别
2025-09-05 v5
摘要
语音驱动 3D 面部动画旨在从任意音频片段生成逼真的唇部动作和面部表情。虽然现有扩散方法能够产生自然动作,但其慢的生成速度限制了应用潜力。本文引入一种新型自回归模型,通过学习从语音到多尺度运动 codebooks 的映射,实现高度同步的唇部动作和逼真的头部姿态与眨眼。此外,该模型可适应未见过的说话风格,实现超越训练中所见身份的独特个人风格的 3D 说话化身。广泛的评估和用户研究表明,我们的方法在唇部同步准确性和感知质量方面优于现有方法。
关键词
引用
@article{arxiv.2502.20323,
title = {ARTalk: Speech-Driven 3D Head Animation via Autoregressive Model},
author = {Xuangeng Chu and Nabarun Goswami and Ziteng Cui and Hanqin Wang and Tatsuya Harada},
journal= {arXiv preprint arXiv:2502.20323},
year = {2025}
}
备注
SIGGRAPH Asia 2025, More video demonstrations, code, models and data can be found on our project website: http://xg-chu.site/project_artalk/