对抗合成分析法——一种语音声码化的新方法
音频与语音处理
2019-07-02 v1 机器学习
声音
摘要
经典的参数化语音编码技术为语音信号提供了一种紧凑的表示。这使得传输速率非常低,但重构信号的感知质量有所下降。近来,WaveNet和SampleRNN等自回归深度生成模型已被用作语音声码器,以在不提高编码速率的情况下提升重构信号的感知质量。然而,此类模型由于其逐样本建模方式,信号生成机制非常缓慢。在本工作中,我们提出了一种基于生成对抗网络(GANs)的神经语音声码化新方法。利用条件GANs作为深度生成模型,由声门激励的极压缩表示生成伪造语音信号。随后使用该原始语音信号的LPC参数对该伪造语音进行精炼,以获得自然的重构。基于该方法重构的语音波形,在由30名男性和女性说话人组成的数据集的主观与客观评测分数上,显示出高于经典声码器对应物的感知质量。此外,与自回归生成模型相比,GANs的使用使得信号能够一次性生成。这使得GANs有望被探索用于实现高质量神经声码器。
引用
@article{arxiv.1907.00772,
title = {Analysis by Adversarial Synthesis -- A Novel Approach for Speech Vocoding},
author = {Ahmed Mustafa and Arijit Biswas and Christian Bergler and Julia Schottenhamml and Andreas Maier},
journal= {arXiv preprint arXiv:1907.00772},
year = {2019}
}
备注
Accepted to Interspeech 2019