中文

面向含噪目标说话人的高质量语音转换的噪声无关语音表征学习

声音 2022-07-05 v1 音频与语音处理

摘要

为含噪目标说话人(例如提供含噪样本的用户或网络抓取数据)构建语音转换系统是一项具有挑战性的任务,因为在模型训练中使用受污染语音将明显 degrade 转换性能。本文利用我们近期提出的 Glow-WaveGAN 的进展,提出一种噪声无关语音表征学习方法,用于含噪目标说话人的高质量语音转换。具体地,我们学习一个潜在特征空间,其中确保转换模型所建模的目标分布恰好来自波形生成器所建模的分布。在此前提下,我们进一步使潜在特征做到噪声不变。具体而言,我们引入一种噪声可控 WaveGAN,其通过编码器直接从波形学习噪声无关声学表征,并在解码器中通过 FiLM 模块在隐空间进行噪声控制。至于转换模型,重要的是,我们使用基于流的模型从音素后验图学习噪声无关但说话人相关的潜在特征分布。实验结果表明,所提模型在含噪目标说话人的语音转换中实现了高语音质量与说话人相似度。

关键词

引用

@article{arxiv.2207.00756,
  title  = {Learning Noise-independent Speech Representation for High-quality Voice Conversion for Noisy Target Speakers},
  author = {Liumeng Xue and Shan Yang and Na Hu and Dan Su and Lei Xie},
  journal= {arXiv preprint arXiv:2207.00756},
  year   = {2022}
}

备注

Accepted by INTERSPEECH 2022