中文

看见你的语音风格:一种新颖的零样本身份解耦面部语音转换

声音 2024-09-05 v1 人工智能 计算机视觉与模式识别 音频与语音处理

摘要

面部语音转换(FVC)是一项利用面部图像生成目标说话人语音风格的新任务。以往工作存在两个缺点:(1)难以获取与说话人语音身份信息良好对齐的面部嵌入,(2)从音频输入中解耦内容与说话人身份信息的能力不足。为解决这些问题,我们提出了一种新颖的FVC方法——身份解耦面部语音转换(ID-FaceVC),该方法克服了上述两个局限。更具体地说,我们提出了一个基于身份感知查询的对比学习(IAQ-CL)模块来提取说话人特定的面部特征,以及一个基于互信息的双重解耦(MIDD)模块来纯化音频中的内容特征,从而确保清晰且高质量的语音转换。此外,与先前工作不同,我们的方法可以接受音频或文本输入,提供可调节情感语调和速度的可控语音生成。大量实验表明,ID-FaceVC在各项指标上均达到了最先进的性能,定性和用户研究结果证实了其在自然度、相似度和多样性方面的有效性。包含音频样本和代码的项目网站见 https://id-facevc.github.io。

关键词

引用

@article{arxiv.2409.00700,
  title  = {Seeing Your Speech Style: A Novel Zero-Shot Identity-Disentanglement Face-based Voice Conversion},
  author = {Yan Rong and Li Liu},
  journal= {arXiv preprint arXiv:2409.00700},
  year   = {2024}
}