中文

面向任意说话人的语音转换:基于条件扩散模型的端到端表达语音转换

音频与语音处理 2024-05-06 v1 声音

摘要

表达语音转换(VC)通过同时转换说话人身份和情感风格来实现情感说话人的说话人身份转换。情感风格建模针对任意说话人在表达 VC 中尚未得到广泛探索。以往方法依赖声码器进行语音重建,使语音质量严重依赖声码器性能。表达 VC 的主要挑战在于情感语音的建模。为此,本文提出一种基于条件去噪扩散概率模型(DDPM)的完全端到端表达 VC 框架。我们利用来自自监督语音模型的语音单元作为内容条件,同时提取语音情感识别和说话人验证系统中的深层特征,以建模情感风格和说话人身份。客观和主观评估均显示本框架的有效性。代码和样例已公开。

关键词

引用

@article{arxiv.2405.01730,
  title  = {Converting Anyone's Voice: End-to-End Expressive Voice Conversion with a Conditional Diffusion Model},
  author = {Zongyang Du and Junchen Lu and Kun Zhou and Lakshmish Kaushik and Berrak Sisman},
  journal= {arXiv preprint arXiv:2405.01730},
  year   = {2024}
}

备注

Accepted by Speaker Odyssey 2024