中文

基于原始波形映射与全卷积网络的多通道语音增强

声音 2020-02-25 v3 机器学习 音频与语音处理

摘要

近年来,基于波形映射的语音增强(SE)方法引起了显著关注。这些方法通常使用深度学习模型直接处理并重建语音波形。由于输入输出均为波形格式,基于波形映射的 SE 方法可克服谱映射 SE 系统中可能遇到的不完善相位估计所引起的失真。迄今为止,大多数基于波形映射的 SE 方法聚焦于单通道任务。本文中,我们提出一种具有 Sinc 与膨胀卷积层(称为 SDFCN)的新型全卷积网络(FCN)用于时域多通道 SE。我们还提出了 SDFCN 的扩展版本,称为残差 SDFCN(记为 rSDFCN)。所提方法在两个多通道 SE 任务上评估,即双通道内耳麦克风 SE 任务与分布式麦克风 SE 任务。实验结果证实了所提 SE 系统在两项任务上的出色去噪能力,以及使用残差结构对整体 SE 性能的益处。

关键词

引用

@article{arxiv.1909.11909,
  title  = {Multichannel Speech Enhancement by Raw Waveform-mapping using Fully Convolutional Networks},
  author = {Chang-Le Liu and Sze-Wei Fu and You-Jin Li and Jen-Wei Huang and Hsin-Min Wang and Yu Tsao},
  journal= {arXiv preprint arXiv:1909.11909},
  year   = {2020}
}

备注

Accepted to IEEE/ACM Transactions on Audio, Speech and Language Processing