中文

利用噪声嵌入将语音增强扩展至未知环境

音频与语音处理 2018-10-31 v1 机器学习 声音 机器学习

摘要

我们通过两种操作解决语音增强对未知环境的泛化问题。首先,我们嵌入一段仅来自该环境的额外录音,并利用该嵌入来调整主增强子网络中的激活值。其次,我们将训练时出现的噪声环境数量扩展到 16,784 个不同环境。实验结果表明,两种操作均降低了预训练语音识别系统的词错误率,并根据多项性能指标改善了增强质量。具体而言,我们的最佳模型将噪声语音上的词错误率从 34.04% 降低到增强语音上的 15.46%。增强音频样本可在 https://speechenhancement.page.link/samples 找到。

关键词

引用

@article{arxiv.1810.12757,
  title  = {Scaling Speech Enhancement in Unseen Environments with Noise Embeddings},
  author = {Gil Keren and Jing Han and Björn Schuller},
  journal= {arXiv preprint arXiv:1810.12757},
  year   = {2018}
}