中文

从单语自动语音识别到无转写跨语言语音转换的迁移学习

音频与语音处理 2020-10-01 v1 机器学习 声音

摘要

跨语言语音转换(VC)旨在合成具有相同内容但源与目标说话人使用不同语言的目标语音。其挑战在于源与目标数据天然非平行,且即便无转写提供时也难以弥合语言间的鸿沟。本文关注从单语ASR到跨语言VC的知识迁移,以解决内容不匹配问题。为此,我们首先训练源语言单语声学模型,用它为VC数据集中所有语音提取音素特征,再训练Seq2Seq转换模型预测梅尔频谱。我们在无任何转写或外语语音特定语言知识的情况下成功解决了跨语言VC。我们在Voice Conversion Challenge 2020数据集上实验,表明我们的说话人相关转换模型优于零样本基线,在跨语言转换的语音质量与说话人相似度上分别取得3.83与3.54的MOS。与级联ASR-TTS方法相比,我们所提方法显著减小了语内与跨语言转换间的MOS下降。

关键词

引用

@article{arxiv.2009.14668,
  title  = {Transfer Learning from Monolingual ASR to Transcription-free Cross-lingual Voice Conversion},
  author = {Che-Jui Chang},
  journal= {arXiv preprint arXiv:2009.14668},
  year   = {2020}
}