SkipConvNet:基于最优平滑谱映射的跳跃卷积神经网络语音去混响方法
音频与语音处理
2021-11-10 v1 声音
信号处理
摘要
全卷积网络(FCNs)的可靠性已在近期许多语音应用中被成功证明。这些 FCN 中最流行的变体之一是‘U-Net’,即带跳跃连接的编码器-解码器网络。在本研究中,我们提出‘SkipConvNet’,用多个卷积模块替换每个跳跃连接,为解码器提供直观的特征图而非编码器的输出,以提升网络的学习能力。我们还提出将功率谱密度(PSD)的最优平滑作为预处理步骤,有助于进一步提高网络效率。为评估所提系统,我们使用 REVERB 挑战语料库在相同条件下评估多种增强方法的性能。我们仅关注语音质量的提升及其对后端仅用干净语音训练的语音系统(如语音识别和说话人验证)效率改善的贡献。实验结果表明所提系统持续优于其他方法。
引用
@article{arxiv.2007.09131,
title = {SkipConvNet: Skip Convolutional Neural Network for Speech Dereverberation using Optimally Smoothed Spectral Mapping},
author = {Vinay Kothapally and Wei Xia and Shahram Ghorbani and John H. L. Hansen and Wei Xue and Jing Huang},
journal= {arXiv preprint arXiv:2007.09131},
year = {2021}
}
备注
Submitted to Interspeech2020