基于原始波形映射与全卷积网络的多通道语音增强
声音
2020-02-25 v3 机器学习
音频与语音处理
摘要
近年来,基于波形映射的语音增强(SE)方法引起了显著关注。这些方法通常使用深度学习模型直接处理并重建语音波形。由于输入输出均为波形格式,基于波形映射的 SE 方法可克服谱映射 SE 系统中可能遇到的不完善相位估计所引起的失真。迄今为止,大多数基于波形映射的 SE 方法聚焦于单通道任务。本文中,我们提出一种具有 Sinc 与膨胀卷积层(称为 SDFCN)的新型全卷积网络(FCN)用于时域多通道 SE。我们还提出了 SDFCN 的扩展版本,称为残差 SDFCN(记为 rSDFCN)。所提方法在两个多通道 SE 任务上评估,即双通道内耳麦克风 SE 任务与分布式麦克风 SE 任务。实验结果证实了所提 SE 系统在两项任务上的出色去噪能力,以及使用残差结构对整体 SE 性能的益处。
引用
@article{arxiv.1909.11909,
title = {Multichannel Speech Enhancement by Raw Waveform-mapping using Fully Convolutional Networks},
author = {Chang-Le Liu and Sze-Wei Fu and You-Jin Li and Jen-Wei Huang and Hsin-Min Wang and Yu Tsao},
journal= {arXiv preprint arXiv:1909.11909},
year = {2020}
}
备注
Accepted to IEEE/ACM Transactions on Audio, Speech and Language Processing