中文

基于谱差分直接波形修改的语音转换的泛化

音频与语音处理 2019-07-30 v1 信号处理

摘要

我们提出对基于谱差分的直接波形修改语音转换(DIFFVC)的一项修改,使其能直接作为波形生成模块应用于语音转换模型。近期提出的 DIFFVC 避免使用声码器,同时保留丰富的频谱细节,因此能够生成高质量的转换语音。要应用 DIFFVC 框架,需事先训练一个能从 F0 变换后的输入语音估计谱差分的模型。该要求带来了若干限制,包括估计模型限于并行训练、以及对每个转换对需额外训练,这使 DIFFVC 缺乏灵活性。基于上述动机,我们提出一种基于残差域 F0 变换的新 DIFFVC 框架。通过对输入信号进行逆滤波,随后使用转换后的频谱特征对 F0 变换后的残差信号进行合成滤波,谱转换模型无需重新训练也无需能够预测谱差分。我们描述了在此修改下需注意的若干细节,并将所提方法应用于一个非并行、基于变分自编码器(VAE)的谱转换模型,证明了该框架可泛化至任意谱转换模型,且实验评估表明其能优于波形生成过程由声码器完成的基线框架。

关键词

引用

@article{arxiv.1907.11898,
  title  = {Generalization of Spectrum Differential based Direct Waveform Modification for Voice Conversion},
  author = {Wen-Chin Huang and Yi-Chiao Wu and Kazuhiro Kobayashi and Yu-Huai Peng and Hsin-Te Hwang and Patrick Lumban Tobing and Yu Tsao and Hsin-Min Wang and Tomoki Toda},
  journal= {arXiv preprint arXiv:1907.11898},
  year   = {2019}
}

备注

6 pages, 4 figures, 1 table; accepted to the 10th ISCA speech synthesis workshop (SSW10)