利用噪声嵌入将语音增强扩展至未知环境
音频与语音处理
2018-10-31 v1 机器学习
声音
机器学习
摘要
我们通过两种操作解决语音增强对未知环境的泛化问题。首先,我们嵌入一段仅来自该环境的额外录音,并利用该嵌入来调整主增强子网络中的激活值。其次,我们将训练时出现的噪声环境数量扩展到 16,784 个不同环境。实验结果表明,两种操作均降低了预训练语音识别系统的词错误率,并根据多项性能指标改善了增强质量。具体而言,我们的最佳模型将噪声语音上的词错误率从 34.04% 降低到增强语音上的 15.46%。增强音频样本可在 https://speechenhancement.page.link/samples 找到。
引用
@article{arxiv.1810.12757,
title = {Scaling Speech Enhancement in Unseen Environments with Noise Embeddings},
author = {Gil Keren and Jing Han and Björn Schuller},
journal= {arXiv preprint arXiv:1810.12757},
year = {2018}
}