基于域对抗训练的噪声鲁棒语音转换
声音
2022-01-27 v1 音频与语音处理
摘要
近年来,在录音室质量测试场景下,语音转换在语音质量和说话人相似度方面取得了巨大进展。然而,在实际应用中,来自源说话人或目标说话人的测试语音会受到各种环境噪声的干扰,严重降低语音质量和说话人相似度。本文提出一种新颖的基于编码器-解码器的噪声鲁棒语音转换框架,由说话人编码器、内容编码器、解码器以及两个域对抗神经网络组成。具体而言,我们将说话人与内容表征解耦技术与域对抗训练技术相结合。域对抗训练使得说话人编码器和内容编码器从干净语音和带噪语音中提取的说话人表征与内容表征分别位于同一空间中。这样,学习到的说话人和内容表征是噪声不变的。因此,解码器可将这两个噪声不变表征作为输入来预测干净的转换频谱。实验结果表明,我们所提方法能够在噪声测试场景下合成干净的转换语音,其中源语音和目标语音在训练过程中可能被见过或未见过的噪声类型所污染。此外,语音质量和说话人相似度均得到提升。
引用
@article{arxiv.2201.10693,
title = {Noise-robust voice conversion with domain adversarial training},
author = {Hongqiang Du and Lei Xie and Haizhou Li},
journal= {arXiv preprint arXiv:2201.10693},
year = {2022}
}