中文

基于全卷积网络的原始波形语音增强

机器学习 2017-06-16 v3 机器学习 声音

摘要

本研究提出一种用于原始波形语音增强的全卷积网络(FCN)模型。所提系统以端到端(即波形输入-波形输出)方式执行语音增强,这与大多数仅处理幅度谱(如对数功率谱(LPS))的现有降噪方法不同。由于深度神经网络(DNN)和卷积神经网络(CNN)中涉及的全连接层可能无法准确表征语音信号的局部信息,尤其是高频分量,我们采用全卷积层对波形进行建模。更具体地说,FCN 仅由卷积层组成,因此可以高效且有效地以相对较少的权重保留语音信号的局部时间结构。实验结果表明,基于 DNN 和 CNN 的模型恢复波形高频分量的能力有限,从而导致增强语音的可懂度降低。相比之下,所提出的 FCN 模型不仅能有效恢复波形,而且在短时客观可懂度(STOI)和语音质量感知评估(PESQ)方面均优于基于 LPS 的 DNN 基线。此外,FCN 的模型参数量仅为 DNN 和 CNN 的约 0.2%。

关键词

引用

@article{arxiv.1703.02205,
  title  = {Raw Waveform-based Speech Enhancement by Fully Convolutional Networks},
  author = {Szu-Wei Fu and Yu Tsao and Xugang Lu and Hisashi Kawai},
  journal= {arXiv preprint arXiv:1703.02205},
  year   = {2017}
}