RHR-Net:一种用于语音增强的残差沙漏形循环神经网络
音频与语音处理
2019-04-17 v1 机器学习
声音
信号处理
摘要
当前大多数语音增强模型使用谱图特征,这需要昂贵的变换并导致相位信息丢失。先前的工作通过使用卷积网络学习高分辨率波形上的长程时间相关性克服了这些问题。然而,这些模型受限于内存密集的膨胀卷积与上采样带来的混叠伪影。我们引入了一种端到端的全循环沙漏形带残差连接的神经网络架构,用于基于波形的单通道语音增强。我们的模型可通过降低特征分辨率而不丢失信息来高效捕获长程时间依赖。实验结果表明,我们的模型在六项评估指标上优于最先进的方法。
引用
@article{arxiv.1904.07294,
title = {RHR-Net: A Residual Hourglass Recurrent Neural Network for Speech Enhancement},
author = {Jalal Abdulbaqi and Yue Gu and Ivan Marsic},
journal= {arXiv preprint arXiv:1904.07294},
year = {2019}
}