中文

基于 WaveNet 自编码器的无监督声学单元表示学习用于语音转换

音频与语音处理 2020-08-18 v1 声音

摘要

近年来,语音的无监督表示学习备受关注,例如 ZeroSpeech 挑战赛的广泛兴趣即证明了这一点。本文提出一种基于 WaveNet 自编码器学习帧级表示的新方法。ZeroSpeech 2019 挑战赛中特别受关注的是具有离散潜变量的模型,如矢量量化变分自编码器(VQVAE)。然而这些模型生成的语音质量相对较差。本工作中我们旨在通过两种途径解决该问题:首先使用 WaveNet 作为解码器并直接从潜表示生成波形数据;其次,通过两种替代的解耦学习方法(即实例归一化与切片矢量量化)改善潜表示的低复杂性。该方法在最近的 ZeroSpeech 2020 挑战赛背景下开发与测试。提交给挑战赛的系统输出在自然度(平均意见得分 4.06)上获得首位,在可懂度(字符错误率 0.15)上获得首位,在表示质量(ABX 测试得分 12.5)上获得第三位。本文中的这些及进一步分析表明,转换后语音的质量与声学单元表示可得到良好平衡。

关键词

引用

@article{arxiv.2008.06892,
  title  = {Unsupervised Acoustic Unit Representation Learning for Voice Conversion using WaveNet Auto-encoders},
  author = {Mingjie Chen and Thomas Hain},
  journal= {arXiv preprint arXiv:2008.06892},
  year   = {2020}
}

备注

To be presented in Interspeech 2020