中文

面向社交telepresence的音频驱动实时面部动画

图形学 2025-11-04 v2 计算机视觉与模式识别 机器学习 声音

摘要

我们提出了一个面向社交telepresence的音频驱动实时系统,用于为photorealistic 3D面部头像实现最小延迟。我们的方法的核心是将音频信号转换为实时的面部表情序列的编码器模型,然后将其解码为photorealistic 3D面部头像。利用扩散模型的生成能力,我们捕捉了实现自然沟通所必需的丰富面部表情范围,同时实现了实时性能(<15ms GPU时间)。我们新颖的架构通过两个关键创新实现了低延迟:一个消除对未来输入依赖的在线变换器,以及一个加速迭代去噪的蒸馏管道,使其仅需一步。我们进一步解决了在实时场景中处理连续音频信号的关键设计挑战,逐帧处理时保持一致的动画质量。我们的框架扩展性强,适用于多模态应用,包括情感条件等语义模态,以及配备头戴式眼部摄像头的多模态传感器。实验结果表明,我们的方法在面部动画准确性上显著优于现有离线最先进的基线,推理速度快100到1000倍。我们通过现场VR演示和各种场景(包括多语言演讲)验证了我们的方案。

关键词

引用

@article{arxiv.2510.01176,
  title  = {Audio Driven Real-Time Facial Animation for Social Telepresence},
  author = {Jiye Lee and Chenghui Li and Linh Tran and Shih-En Wei and Jason Saragih and Alexander Richard and Hanbyul Joo and Shaojie Bai},
  journal= {arXiv preprint arXiv:2510.01176},
  year   = {2025}
}

备注

SIGGRAPH Asia 2025. Project page: https://jiyewise.github.io/projects/AudioRTA