中文

混响环境下基于宽残差网络的语音增强

音频与语音处理 2019-04-11 v1 声音

摘要

本文提出一种语音增强方法,其利用了宽残差网络(Wide Residual Network)架构中残差连接的高潜力。该方法基于沿时间域计算的一维卷积,这是通过时域处理上下文相关表示(如语音特征序列)的有力途径。我们发现残差机制对增强任务极为有用,因为信号始终具有线性捷径,而非线性路径通过逐步加或减校正来对其进行增强。所提方法的增强能力通过针对混响语音信号的模拟与真实样本评估的客观质量指标来衡量。结果表明,所提方法优于被称为 WPE 的当前最优方法,后者以有效降低混响并大幅增强信号而著称。所提模型使用人工合成混响数据训练,能够泛化到多种条件下的真实房间脉冲响应(如不同房间尺寸、RT60RT_{60}、近场与远场)。此外,其对来自两个不同数据集的混响真实语音达到了准确效果。

关键词

引用

@article{arxiv.1904.05167,
  title  = {Speech Enhancement with Wide Residual Networks in Reverberant Environments},
  author = {Jorge Llombart and Dayana Ribas and Antonio Miguel and Luis Vicente and Alfonso Ortega and Eduardo Lleida},
  journal= {arXiv preprint arXiv:1904.05167},
  year   = {2019}
}

备注

5 pages, 4 figures. arXiv admin note: text overlap with arXiv:1901.00660, arXiv:1904.04511