中文

使用全卷积网络的语音去混响

音频与语音处理 2019-04-05 v2 声音

摘要

本文探讨了使用单麦克风的语音去混响问题。受全卷积网络 (FCN) 在许多图像处理应用中近期取得成功的启发,我们研究了其在增强以短时傅里叶变换 (STFT) 图像表示的语音信号方面的适用性。我们提出了两种变体:一种是带有跳跃连接的编码器-解码器网络“U-Net”,另一种是以 U-Net 作为生成器的生成对抗网络 (GAN),这为训练提供了一种更直观的代价函数。为了评估我们的方法,我们使用了来自 REVERB 挑战赛的数据,并在相同条件下将我们的结果与其他方法进行了比较。我们发现,在大多数情况下,我们的方法优于竞争方法。

关键词

引用

@article{arxiv.1803.08243,
  title  = {Speech Dereverberation Using Fully Convolutional Networks},
  author = {Ori Ernst and Shlomo E. Chazan and Sharon Gannot and Jacob Goldberger},
  journal= {arXiv preprint arXiv:1803.08243},
  year   = {2019}
}