中文

用于声门激励的说话人无关原始波形模型

音频与语音处理 2018-04-26 v1 声音 机器学习

摘要

近期语音技术研究中,将WaveNet用作统计声码器(即从声学特征生成语音波形)的兴趣日益增长。已在诸多任务(如文本转语音合成与语音转换)中表明,这些模型相较经典声码器提升了生成语音质量。此外,以声学特征调节WaveNet可在无需额外说话人编码的情况下跨多说话人共享波形生成器模型。然而,多说话人WaveNet模型需要大量训练数据与计算以覆盖整个声学空间。本文提出利用语音产生的源-滤波器模型,以有限资源更有效地训练说话人无关波形生成器。我们提出多说话人'GlotNet'声码器,其利用WaveNet生成声门激励波形,再用以激励相应声道滤波器以产生语音。听测表明,所提模型表现优于以相同模型架构与数据训练的直接WaveNet声码器。

关键词

引用

@article{arxiv.1804.09593,
  title  = {Speaker-independent raw waveform model for glottal excitation},
  author = {Lauri Juvela and Vassilis Tsiaras and Bajibabu Bollepalli and Manu Airaksinen and Junichi Yamagishi and Paavo Alku},
  journal= {arXiv preprint arXiv:1804.09593},
  year   = {2018}
}

备注

Submitted to Interspeech 2018