中文

Vclip:基于面部-语音关联学习的面部驱动语音合成

音频与语音处理 2026-01-07 v1

摘要

本文讨论了面部驱动语音合成任务,即将合成语音限制在感知上与参考人脸图像相匹配的个性化语音合成方法。由于缺乏高质量的音视频语料库,先前的方法要么合成质量低,要么因知识迁移方案导致域间不匹配。本文提出了一种新方法Vclip,通过利用CLIP编码器对面部语义知识处理噪声音视频数据,高效地学习面部与语音之间的关联,在Voxceleb测试集上实现89.63%的跨模态验证AUC分数。该方法随后采用检索策略结合GMM-based说话人生成模块,用于下游TTS系统,以生成给定参考图像的可能目标说话人。实验结果表明,结合检索步骤的Vclip系统能够为面部驱动语音合成桥接面部特征与语音特征之间的差距。利用来自下游TTS的反馈信息有助于合成与参考人脸高度吻合的语音。演示可在sos1sos2sixteen.github.io/vclip查看。

关键词

引用

@article{arxiv.2601.02753,
  title  = {Vclip: Face-based Speaker Generation by Face-voice Association Learning},
  author = {Yao Shi and Yunfei Xu and Hongbin Suo and Yulong Wan and Haifeng Liu},
  journal= {arXiv preprint arXiv:2601.02753},
  year   = {2026}
}

备注

work done in 2023