中文

倾听静默之声用于语音去噪

声音 2020-10-26 v1 机器学习 音频与语音处理

摘要

我们介绍了一种用于语音去噪的深度学习模型,这是音频分析中众多应用长期存在的挑战。我们的方法基于关于人类语音的一个关键观察:在每个句子或单词之间通常有一个短暂停顿。在录制的语音信号中,这些停顿引入了一系列仅存在噪声的时间段。我们利用这些偶然的静默间隔,在仅给定单声道音频的情况下学习自动语音去噪模型。随时间检测到的静默间隔不仅暴露纯噪声,还暴露其时变特征,使模型能够学习噪声动态并从语音信号中抑制它。在多个数据集上的实验证实了静默间隔检测对语音去噪的关键作用,且我们的方法优于几种最先进的去噪方法,包括仅接受音频输入(如 ours)和基于视听输入去噪(因此需要更多信息)的方法。我们还表明,我们的方法具有良好的泛化特性,例如可对所训练时未见过的口语进行去噪。

关键词

引用

@article{arxiv.2010.12013,
  title  = {Listening to Sounds of Silence for Speech Denoising},
  author = {Ruilin Xu and Rundi Wu and Yuko Ishiwaka and Carl Vondrick and Changxi Zheng},
  journal= {arXiv preprint arXiv:2010.12013},
  year   = {2020}
}

备注

9 pages, 6 figures, accepted in NeurIPS 2020; Sound examples can be found at http://www.cs.columbia.edu/cg/listen_to_the_silence/