使用全卷积网络的语音去混响
音频与语音处理
2019-04-05 v2 声音
摘要
本文探讨了使用单麦克风的语音去混响问题。受全卷积网络 (FCN) 在许多图像处理应用中近期取得成功的启发,我们研究了其在增强以短时傅里叶变换 (STFT) 图像表示的语音信号方面的适用性。我们提出了两种变体:一种是带有跳跃连接的编码器-解码器网络“U-Net”,另一种是以 U-Net 作为生成器的生成对抗网络 (GAN),这为训练提供了一种更直观的代价函数。为了评估我们的方法,我们使用了来自 REVERB 挑战赛的数据,并在相同条件下将我们的结果与其他方法进行了比较。我们发现,在大多数情况下,我们的方法优于竞争方法。
引用
@article{arxiv.1803.08243,
title = {Speech Dereverberation Using Fully Convolutional Networks},
author = {Ori Ernst and Shlomo E. Chazan and Sharon Gannot and Jacob Goldberger},
journal= {arXiv preprint arXiv:1803.08243},
year = {2019}
}