中文

利用宽残差网络对混响与含噪信号进行深度语音增强

声音 2019-01-04 v1 机器学习 机器学习

摘要

本文提出一种深度语音增强方法,其利用了残差连接在宽神经网络架构(一种称为宽残差网络 (Wide Residual Network) 的拓扑结构)中的高潜力。该方法基于沿时间域计算的一维卷积,这是通过时域处理上下文相关表示(如语音特征序列)的有力途径。我们发现残差机制对增强任务极为有用,因为信号始终具有线性捷径,而非线性路径通过逐步加减校正来对其进行增强。所提方法的增强能力通过客观质量指标和语音识别系统的性能进行评估。这在 REVERB Challenge 数据集框架下完成评估,包含混响和含噪语音信号的模拟与真实样本。结果表明,所提方法增强后的语音在以增强可懂度为目的的增强任务和语音识别系统中均取得成功。该 DNN 模型使用人工合成混响数据训练,能够处理真实场景中的远场混响语音。此外,该方法能够利用残差连接增强低噪声水平信号,而这通常是以往传统增强方法的严重短板。

关键词

引用

@article{arxiv.1901.00660,
  title  = {Deep Speech Enhancement for Reverberated and Noisy Signals using Wide Residual Networks},
  author = {Dayana Ribas and Jorge Llombart and Antonio Miguel and Luis Vicente},
  journal= {arXiv preprint arXiv:1901.00660},
  year   = {2019}
}