无需干净训练数据的语音降噪:一种 Noise2Noise 方法
声音
2021-09-21 v2 机器学习
音频与语音处理
摘要
本文通过表明仅使用含噪语音样本即可训练深度语音降噪网络,解决了基于深度学习的音频降噪方法对干净语音数据的严重依赖问题。传统观念认为,为获得良好的语音降噪性能,需要大量含噪语音样本和完全干净的语音样本,从而导致对昂贵音频录制设备和极度受控的隔音录音棚的需求。这些数据收集要求带来了重大挑战,尤其是在经济欠发达地区和资源匮乏的语言中。本工作表明,仅利用含噪训练音频即可成功训练语音降噪深度神经网络。此外,本文揭示,在涉及复杂噪声分布和低信噪比(高噪声环境)的情况下,此类训练机制相比利用干净训练音频目标 conventional 训练机制取得了更优的降噪性能。通过使用 20 层 Deep Complex U-Net 架构在真实世界噪声和合成噪声上研究我们提出方法的有效性,证明了这一点。
引用
@article{arxiv.2104.03838,
title = {Speech Denoising Without Clean Training Data: A Noise2Noise Approach},
author = {Madhav Mahesh Kashyap and Anuj Tambwekar and Krishnamoorthy Manohara and S Natarajan},
journal= {arXiv preprint arXiv:2104.03838},
year = {2021}
}
备注
Published in Interspeech 2021 ( See https://www.isca-speech.org/archive/interspeech_2021/kashyap21_interspeech.html ). 5 pages, 2 figures, 1 table