中文

在U-net架构中利用时域与频域循环结构进行语音增强

机器学习 2018-11-19 v1 声音 音频与语音处理 机器学习

摘要

在设计全卷积神经网络时,需要在感受野大小、参数数量以及网络深层特征的空间分辨率之间进行权衡。本工作中,我们提出了一种基于大量卷积层与循环层组合的新型网络设计,解决了这些难题。我们在语音增强任务上将我们的方案与文献中已知的基于U-net的模型及其他基线模型进行比较。我们在TIMIT语音语句与从NOISEX-92数据库提取的噪声段混合的数据上测试了我们的方案,并显示出相比当前最先进方法,所提方案在SDR(信失真比)、SIR(信干扰比)和STOI(谱时客观可懂度)指标上具有明显优势。

关键词

引用

@article{arxiv.1811.06805,
  title  = {Using recurrences in time and frequency within U-net architecture for speech enhancement},
  author = {Tomasz Grzywalski and Szymon Drgas},
  journal= {arXiv preprint arXiv:1811.06805},
  year   = {2018}
}