中文

基于深度特征损失的语音去噪

音频与语音处理 2018-09-18 v2 声音

摘要

我们提出一种端到端深度学习方法,通过直接处理原始波形来对语音信号去噪。给定被加性背景信号污染的含语音输入音频,系统旨在产生仅包含语音内容的处理后信号。近期方法已使用多种深度网络架构展现出有前景的结果。在本文中,我们提出使用深度特征损失训练一个全卷积上下文聚合网络。该损失基于比较另一个为声学环境检测与家用音频标注所训练网络的内部特征激活。我们的方法在客观语音质量指标及大规模人类听者感知实验中均优于当前最优(SOTA)。它也优于使用传统回归损失训练的相同网络。新方法的优势在最难数据(具有最强侵入性背景噪声,最需去噪也最具挑战性)上尤为显著。

关键词

引用

@article{arxiv.1806.10522,
  title  = {Speech Denoising with Deep Feature Losses},
  author = {Francois G. Germain and Qifeng Chen and Vladlen Koltun},
  journal= {arXiv preprint arXiv:1806.10522},
  year   = {2018}
}

备注

Code can be found at https://github.com/francoisgermain/SpeechDenoisingWithDeepFeatureLosses . Sound examples can be found at https://ccrma.stanford.edu/~francois/SpeechDenoisingWithDeepFeatureLosses/