中文

基于分层递归神经网络用于语音带宽扩展的波形建模与生成

声音 2018-01-26 v1 音频与语音处理

摘要

本文提出一种使用分层递归神经网络(HRNN)进行语音带宽扩展(BWE)的波形建模与生成方法。与预测频谱参数以重建宽带语音波形的传统 BWE 方法不同,该 BWE 方法直接对波形采样点进行建模和预测,无需使用声码器。受无条件神经音频生成器 SampleRNN 的启发,HRNN 模型使用由长短期记忆(LSTM)层和前馈(FF)层组成的神经网络,以输入的窄带波形采样点为条件表示每个宽带或高频波形采样的分布。LSTM 层形成分层结构,每层以特定时间分辨率运行,以有效捕获时间序列之间的长跨度依赖关系。此外,还采用额外条件,例如使用基于深度神经网络(DNN)的状态分类器从窄带语音导出的瓶颈(BN)特征,作为辅助输入以进一步提高生成宽带语音的质量。比较几种波形建模方法的实验结果表明,基于 HRNN 的方法比基于扩张卷积神经网络(DCNN)的方法和基于普通采样级递归神经网络(SRNN)的方法能获得更好的语音质量和运行效率。我们提出的方法在重建宽带语音的主观质量方面也优于使用 LSTM-RNN 的基于声码器的传统 BWE 方法。

关键词

引用

@article{arxiv.1801.07910,
  title  = {Waveform Modeling and Generation Using Hierarchical Recurrent Neural Networks for Speech Bandwidth Extension},
  author = {Zhen-Hua Ling and Yang Ai and Yu Gu and Li-Rong Dai},
  journal= {arXiv preprint arXiv:1801.07910},
  year   = {2018}
}

备注

Accepted by IEEE Transactions on Audio, Speech and Language Processing