中文

基于 SNR 的特征与多样化训练数据用于鲁棒 DNN 语音增强

音频与语音处理 2021-06-18 v2 机器学习 声音

摘要

本文中,针对训练数据在规模和多样性上受限的情况,我们研究基于深度神经网络(DNN)的语音增强对未知噪声条件的泛化能力。为获得更多见解,我们分析了关于以下方面的泛化:(1)训练数据的规模和多样性,(2)不同的网络架构,以及(3)所选特征。针对(1),我们在 Hu 噪声语料库(规模有限)、CHiME 3 噪声语料库(多样性有限)上训练网络,并提出了基于自由可用声音收集的大规模多样化数据集。针对(2),我们比较了全连接前馈和长短期记忆(LSTM)架构。针对(3),我们比较了三种输入特征,即对数化含噪周期图、噪声感知训练(NAT)和提出的基于信噪比(SNR)的噪声感知训练(SNR-NAT)。我们确认丰富的训练数据和改进的网络架构有助于 DNN 泛化。此外,我们通过实验结果及使用 t 分布随机邻域嵌入(t-SNE)的分析表明,所提出的 SNR-NAT 特征即使在简单网络架构且仅在小数据集上训练时,也能在未知噪声中产生鲁棒且与电平无关的结果,这是本文的关键贡献。

关键词

引用

@article{arxiv.2004.03512,
  title  = {SNR-Based Features and Diverse Training Data for Robust DNN-Based Speech Enhancement},
  author = {Robert Rehr and Timo Gerkmann},
  journal= {arXiv preprint arXiv:2004.03512},
  year   = {2021}
}