中文

利用生成对抗网络从 MFCC 序列合成语音波形

音频与语音处理 2018-04-04 v1 计算与语言 声音 机器学习

摘要

本文提出了一种从 filterbank mel 频率倒谱系数(MFCC)生成语音的方法。MFCC 在语音应用(如 ASR)中被广泛使用,但通常被认为不适用于语音合成。首先,我们使用自回归循环神经网络从 MFCC 预测基频和浊音信息。其次,将 MFCC 中包含的频谱包络信息转换为全极点滤波器,并训练与这些滤波器匹配的基音同步激励模型。最后,我们引入基于生成对抗网络的噪声模型,以向建模的激励信号中添加真实的高频随机分量。结果表明,在测试时仅给定 MFCC 信息即可获得高质量的语音重建。

关键词

引用

@article{arxiv.1804.00920,
  title  = {Speech waveform synthesis from MFCC sequences with generative adversarial networks},
  author = {Lauri Juvela and Bajibabu Bollepalli and Xin Wang and Hirokazu Kameoka and Manu Airaksinen and Junichi Yamagishi and Paavo Alku},
  journal= {arXiv preprint arXiv:1804.00920},
  year   = {2018}
}