中文

从音频到视频的桥梁:基于音素-口型对齐的多语言说话人脸

计算机视觉与模式识别 2025-10-09 v1

摘要

语音驱动说话人脸合成(TFS)旨在从音频输入生成逼真的面部动画。当前TFS模型在英语表现良好,但在非英语语言表现不佳,产生错误的口型和僵硬的面部表情。其表现差的原因在于英语主导的训练数据集以及缺乏跨语言泛化能力。为此,我们提出了一种名为Multilingual Experts(MuEx)的新型框架,采用Phoneme-Guided Mixture-of-Experts(PG-MoE)架构,将音素和口型作为通用的中间介质,桥接音频和视频模态,实现逼真的多语言TFS。为缓解语言差异和数据集偏差的影响,我们分别提取音频和视频特征作为音素和口型,这是语音声音和口型运动的基本单元。为解决音视频同步问题,我们引入音素-口型对齐机制(PV-Align),在音素和口型之间建立稳健的跨模态对应关系。此外,我们构建了一个包含12种多样化语言、95.04小时高质量视频的多语言说话人脸基准数据集(MTFB),用于训练和评估多语言TFS性能。大量实验表明,MuEx在MTFB中的所有语言上均表现出优异性能,并能对未见过的语言实现有效的零样本泛化。

关键词

引用

@article{arxiv.2510.06612,
  title  = {A Bridge from Audio to Video: Phoneme-Viseme Alignment Allows Every Face to Speak Multiple Languages},
  author = {Zibo Su and Kun Wei and Jiahua Li and Xu Yang and Cheng Deng},
  journal= {arXiv preprint arXiv:2510.06612},
  year   = {2025}
}