重新审视复值深度神经网络在单通道语音增强中的有效性
声音
2023-01-12 v1 机器学习
音频与语音处理
摘要
尽管在采用复值深度神经网络(DNN)方面已做出诸多努力,但复值 DNN 是否普遍比实值 DNN 更适用于单通道语音增强仍是一个开放问题。本工作致力于通过系统比较复值 DNN 与其实值对应模型来给出批判性评估。具体而言,我们研究了复值 DNN 的基本单元,包括线性层、卷积层、长短期记忆(LSTM)和门控线性单元。通过比较近期提出的门控卷积循环网络(GCRN)中基本构建块的复值与实值版本,我们展示了不同基础块机制如何影响性能。我们还发现,当模型规模较小时,使用复值运算会限制模型容量。此外,我们考察了两种近期提出的复值 DNN,即深度复值卷积循环网络(DCCRN)和深度复值 U-Net(DCUNET)。评估结果表明,这两种 DNN 与其实值对应模型性能完全一致,却需要多得多的计算量。基于这些全面比较,我们得出结论:在单通道语音增强中,复值 DNN 相比其实值对应模型并未带来性能提升,且因其更高的计算成本而不具优势。
引用
@article{arxiv.2301.04320,
title = {Rethinking complex-valued deep neural networks for monaural speech enhancement},
author = {Haibin Wu and Ke Tan and Buye Xu and Anurag Kumar and Daniel Wong},
journal= {arXiv preprint arXiv:2301.04320},
year = {2023}
}