噪声环境下多样化语音转换的数据增强
音频与语音处理
2023-05-19 v1 声音
摘要
语音转换(VC)模型在其所训练的干净母语语音群体上展现了令人印象深刻的少样本转换质量。然而,当源或目标语音的口音、背景噪声条件或麦克风特性与训练数据不同时,高质量语音转换无法保证。这些问题在 VC 研究中常被忽视,导致用户在使用预训练 VC 模型处理自身数据时感到挫败。我们关注于从自录样本中保留口音的姓名发音语音转换,该领域同时存在上述三种情况,并假定在此领域展示更高性能有助于构建令受挫用户更易使用的 VC 模型。我们证明,现有的 SOTA 编码器-解码器 VC 模型可通过在预训练中使用更多样的数据和简单的数据增强技术,对这些变化变得鲁棒并具备自然去噪能力。
引用
@article{arxiv.2305.10684,
title = {Data Augmentation for Diverse Voice Conversion in Noisy Environments},
author = {Avani Tanna and Michael Saxon and Amr El Abbadi and William Yang Wang},
journal= {arXiv preprint arXiv:2305.10684},
year = {2023}
}
备注
Interspeech 2023 Show and Tell, 2 pp