中文

学习解缠的语音与表情驱动式 Blendshapes,用于 3D 说话人脸动画

计算机视觉与模式识别 2025-10-30 v1 人工智能 图形学

摘要

表情是传递人类情感的基本方式。随着 AI 生成内容(AIGC)的快速发展,实现真实且富有表现力的 3D 人脸动画变得日益重要。尽管近期在语音驱动的唱脸同步方面取得进展,但生成带情感表达的说话人脸仍鲜有探索。一个主要障碍是由于数据捕获成本高昂,导致缺乏真实情感 3D 说话人脸数据集。为此,本文将语音和情感驱动的人脸动画建模为线性可加问题。利用带中性表情的说话人脸数据集(VOCAset)和 3D 表情序列数据集(Florence4D),我们联合学习一组由语音和情感驱动的 blendshapes。我们引入稀疏约束损失,以鼓励两种类型 blendshapes 之间的解缠,同时允许模型捕捉训练数据中固有的次级跨域形变。所学得的 blendshapes 可进一步映射到 FLAME 模型的表情和颚姿态参数,从而实现对 3D 高斯头像的动画。定性和定量实验表明,我们的方法自然生成具有指定表情的说话人脸,同时保持准确的唇同步。感知研究进一步表明,我们的方法在情感表达方面优于现有方法,且未损害唇同步质量。

关键词

引用

@article{arxiv.2510.25234,
  title  = {Learning Disentangled Speech- and Expression-Driven Blendshapes for 3D Talking Face Animation},
  author = {Yuxiang Mao and Zhijie Zhang and Zhiheng Zhang and Jiawei Liu and Chen Zeng and Shihong Xia},
  journal= {arXiv preprint arXiv:2510.25234},
  year   = {2025}
}

备注

18 pages, 6 figures, accepted to ICXR 2025 conference