中文

探索用于基于回归语音增强的深度混合张量到向量网络架构

音频与语音处理 2020-08-04 v2 计算与语言 机器学习 神经与进化计算 声音

摘要

本文通过采用若干深度张量到向量回归模型进行语音增强,研究了模型参数量与增强语音质量之间的不同权衡。我们发现一种混合架构,即 CNN-TT,能够以缩减的模型参数量维持良好的质量性能。CNN-TT 由底部若干卷积层用于特征提取以改善语音质量,以及顶部张量列(TT)输出层用于减少模型参数构成。我们首先推导了基于卷积神经网络(CNN)的向量到向量回归模型泛化能力的一个新上界。随后,我们在 Edinburgh 噪声语音语料库上给出实验证据,表明在单通道语音增强中,CNN 以模型规模小幅增加为代价优于 DNN。此外,CNN-TT 仅利用 CNN 模型参数的 32% 便略优于 CNN 对应模型。此外,若将 CNN-TT 参数量增至 CNN 模型规模的 44%,可获得进一步的性能提升。最后,我们在模拟噪声 WSJ0 语料库上的多通道语音增强实验表明,我们提出的混合 CNN-TT 架构在更佳的增强语音质量与更小的参数规模方面均优于 DNN 与 CNN 模型。

关键词

引用

@article{arxiv.2007.13024,
  title  = {Exploring Deep Hybrid Tensor-to-Vector Network Architectures for Regression Based Speech Enhancement},
  author = {Jun Qi and Hu Hu and Yannan Wang and Chao-Han Huck Yang and Sabato Marco Siniscalchi and Chin-Hui Lee},
  journal= {arXiv preprint arXiv:2007.13024},
  year   = {2020}
}

备注

Accepted to InterSpeech 2020