中文

基于 Wave-U-Net 的改进语音增强

声音 2018-11-29 v1 机器学习 神经与进化计算 音频与语音处理 信号处理

摘要

我们研究了 Wave-U-Net 架构在语音增强中的使用,该模型由 Stoller 等人提出用于音乐人声与伴奏的分离。这种用于音频源分离的端到端学习方法直接在时域上操作,允许对相位信息进行集成建模,并能够考虑大的时间上下文。我们的实验表明,在 Voice Bank 语料库(VCTK)数据集上,针对语音增强任务,所提方法在 PESQ、CSIG、CBAK、COVL 和 SSNR 等多个指标上优于当前最优(SOTA)方法。我们发现,与最初为音乐中歌唱声音分离设计的原始系统相比,较少的隐藏层即足以进行语音增强。我们将这一初步结果视为进一步探索时域语音增强的鼓舞性信号,既作为目标本身,也作为语音识别系统的预处理步骤。

关键词

引用

@article{arxiv.1811.11307,
  title  = {Improved Speech Enhancement with the Wave-U-Net},
  author = {Craig Macartney and Tillman Weyde},
  journal= {arXiv preprint arXiv:1811.11307},
  year   = {2018}
}

备注

5 pages (including 1 for References), 1 figure, 2 tables