探索用于基于回归语音增强的深度混合张量到向量网络架构
音频与语音处理
2020-08-04 v2 计算与语言
机器学习
神经与进化计算
声音
摘要
本文通过采用若干深度张量到向量回归模型进行语音增强,研究了模型参数量与增强语音质量之间的不同权衡。我们发现一种混合架构,即 CNN-TT,能够以缩减的模型参数量维持良好的质量性能。CNN-TT 由底部若干卷积层用于特征提取以改善语音质量,以及顶部张量列(TT)输出层用于减少模型参数构成。我们首先推导了基于卷积神经网络(CNN)的向量到向量回归模型泛化能力的一个新上界。随后,我们在 Edinburgh 噪声语音语料库上给出实验证据,表明在单通道语音增强中,CNN 以模型规模小幅增加为代价优于 DNN。此外,CNN-TT 仅利用 CNN 模型参数的 32% 便略优于 CNN 对应模型。此外,若将 CNN-TT 参数量增至 CNN 模型规模的 44%,可获得进一步的性能提升。最后,我们在模拟噪声 WSJ0 语料库上的多通道语音增强实验表明,我们提出的混合 CNN-TT 架构在更佳的增强语音质量与更小的参数规模方面均优于 DNN 与 CNN 模型。
引用
@article{arxiv.2007.13024,
title = {Exploring Deep Hybrid Tensor-to-Vector Network Architectures for Regression Based Speech Enhancement},
author = {Jun Qi and Hu Hu and Yannan Wang and Chao-Han Huck Yang and Sabato Marco Siniscalchi and Chin-Hui Lee},
journal= {arXiv preprint arXiv:2007.13024},
year = {2020}
}
备注
Accepted to InterSpeech 2020