迈向抗退化鲁棒的语音转换
音频与语音处理
2022-05-02 v3 机器学习
声音
摘要
任意到任意语音转换技术将一段语音的音色转换为任意说话人,即使该说话人在训练期间未见。尽管已有若干最先进的任意到任意语音转换模型,但它们均基于干净语音才能成功转换。然而,在真实场景中,收集说话人的干净语音十分困难,语音通常被噪声或混响所退化。因此,理解这些退化如何影响语音转换并构建抗退化鲁棒模型变得极为迫切。本文首次对任意到任意语音转换的退化鲁棒性进行了全面研究。我们表明,当前最先进模型在给定退化语音时性能严重受损。为此,我们提出语音增强级联和去噪训练以提高鲁棒性。除常见退化外,我们还考虑了对抗性噪声,这类噪声能显著改变模型输出却为人耳所不可感知。研究表明,与现成语音增强模型级联以及对语音转换模型进行去噪训练均可提高鲁棒性,但二者各有优劣。
引用
@article{arxiv.2110.07537,
title = {Toward Degradation-Robust Voice Conversion},
author = {Chien-yu Huang and Kai-Wei Chang and Hung-yi Lee},
journal= {arXiv preprint arXiv:2110.07537},
year = {2022}
}
备注
To appear in the proceedings of ICASSP 2022, equal contribution from first two authors