波形域中的实时语音增强
音频与语音处理
2020-09-08 v3 机器学习
声音
机器学习
摘要
我们提出一种在原始波形上工作、在笔记本电脑CPU上实时运行的因果语音增强模型。所提模型基于带跳跃连接的编码器-解码器架构。它在时域和频域上使用多损失函数进行优化。经验证据表明,它能够去除包括平稳和非平稳噪声以及房间混响在内的各类背景噪声。此外,我们提出一组直接应用于原始波形的数据增强技术,进一步提升了模型性能及其泛化能力。我们在多个标准基准上进行了评估,同时使用客观指标和人类判断。所提模型在直接处理原始波形时,匹配了因果与非因果方法的state-of-the-art性能。
引用
@article{arxiv.2006.12847,
title = {Real Time Speech Enhancement in the Waveform Domain},
author = {Alexandre Defossez and Gabriel Synnaeve and Yossi Adi},
journal= {arXiv preprint arXiv:2006.12847},
year = {2020}
}
备注
Interspeech 2020 Paper