中文

面向参数语音合成系统的说话人自适应神经声码器

音频与语音处理 2020-08-04 v5 机器学习 声音

摘要

本文提出面向参数文本到语音(TTS)系统的说话人自适应神经声码器。近期提出的基于 WaveNet 的神经声码系统利用自回归框架成功生成了语音信号的时间序列。然而,当目标说话人的训练数据量不足时,合成高质量语音仍具挑战。为在有限训练数据约束下生成更自然的语音信号,我们提出了一种说话人自适应任务,并对神经声码模型进行了有效变体设计。在所提方法中,先采用说话人无关的训练方法以捕捉多位说话人中蕴含的通用属性,随后对训练后的模型进行优化以表征目标说话人的特定特征。实验结果验证,采用说话人自适应神经声码器的 TTS 系统优于基于传统源-滤波器模型的声码器,以及采用说话人相关或说话人无关训练的 WaveNet 声码器的系统。特别地,尽管仅使用十分钟语音语料训练模型,我们的 TTS 系统对韩语男声和韩语女声分别取得了 3.80 和 3.77 的 MOS。

关键词

引用

@article{arxiv.1811.03311,
  title  = {Speaker-adaptive neural vocoders for parametric speech synthesis systems},
  author = {Eunwoo Song and Jin-Seob Kim and Kyungguen Byun and Hong-Goo Kang},
  journal= {arXiv preprint arXiv:1811.03311},
  year   = {2020}
}

备注

Accepted to the IEEE Workshop of MMSP 2020