利用录音质量和环境潜变量的条件去噪训练实现噪声鲁棒语音转换
声音
2024-06-12 v1 音频与语音处理
摘要
我们提出了一种噪声鲁棒的语音转换(VC)方法,该方法考虑了带噪源语音的录音质量和环境。传统的去噪训练通过学习带噪到干净的 VC 过程来提高 VC 模型的噪声鲁棒性。然而,当源语音的噪声在训练中未见时,转换语音的自然度是有限的。为此,我们提出的训练方法将 VC 模型条件化于两个潜变量,这两个潜变量分别代表源语音的录音质量和环境。这些潜变量源自预训练于录音质量评估和声学场景分类的深度神经网络,并以话语级或帧级方式计算。因此,训练后的 VC 模型可以在训练过程中显式学习关于语音退化的信息。客观和主观评估表明,与传统的训练相比,我们的训练提高了转换语音的质量。
引用
@article{arxiv.2406.07280,
title = {Noise-Robust Voice Conversion by Conditional Denoising Training Using Latent Variables of Recording Quality and Environment},
author = {Takuto Igarashi and Yuki Saito and Kentaro Seki and Shinnosuke Takamichi and Ryuichi Yamamoto and Kentaro Tachibana and Hiroshi Saruwatari},
journal= {arXiv preprint arXiv:2406.07280},
year = {2024}
}
备注
5 pages, accepted for INTERSPEECH 2024, audio samples: http://y-saito.sakura.ne.jp/sython/Corpus/SRC4VC/IS2024_CDT_supplementary/demo_cdt.html