中文

LPCSE:基于线性预测编码的神经语音增强

声音 2022-06-23 v2 音频与语音处理

摘要

5G/B5G通信系统对体验质量日益严格的要求催生了新兴的神经语音增强技术,然而这些技术独立于现有的基于专家规则的语音发音与失真模型(如经典线性预测编码(LPC)语音模型)发展,因为难以将这些模型与自动可微机器学习框架集成。本文中,为提高神经语音增强的效率,我们引入了基于LPC的语音增强(LPCSE)架构,其利用了LPC语音模型中强归纳偏置与神经网络表达能力的结合。LPCSE通过两个新颖模块实现可微端到端学习:一个模块利用专家规则降低将LPC语音模型集成到神经网络中的计算开销,另一个模块通过将线性预测系数映射到滤波器极点来确保模型稳定性并避免端到端训练中的梯度爆炸。实验结果表明,LPCSE成功恢复了因传输损耗而失真的语音的共振峰,并且在LJ Speech语料库上,就感知语音质量评估(PESQ)和短时客观可懂度(STOI)而言,优于两种网络规模相当的现有神经语音增强方法。

关键词

引用

@article{arxiv.2206.06908,
  title  = {LPCSE: Neural Speech Enhancement through Linear Predictive Coding},
  author = {Yang Liu and Na Tang and Xiaoli Chu and Yang Yang and Jun Wang},
  journal= {arXiv preprint arXiv:2206.06908},
  year   = {2022}
}