中文

一种基于矩阵乘积算子的语音增强模型压缩方法

声音 2020-10-13 v1 机器学习 音频与语音处理 量子物理

摘要

基于深度神经网络(DNN)的语音增强方法已取得令人满意的性能。然而,这些方法涉及的参数量通常在资源受限设备上的语音增强实际应用中极为庞大,严重限制了其应用。为解决此问题,模型压缩技术正被广泛研究。本文提出一种基于矩阵乘积算子(MPO)的模型压缩方法,以大幅减少语音增强 DNN 模型中的参数量。该方法在训练前将神经网络模型线性变换中的权重矩阵替换为 MPO 分解格式。实验中,此过程应用于因果神经网络模型,如前向多层感知机(MLP)和长短期记忆(LSTM)模型。随后,将带压缩与不带压缩的 MLP 和 LSTM 模型均用于估计单通道语音增强的理想比率掩码。实验结果表明,在各种压缩率下,我们所提的基于 MPO 的方法优于广泛使用的剪枝方法,且在低压缩率下可取得进一步提升。我们的方案为语音增强提供了一种有效的模型压缩方法,尤其在无云端应用中。

关键词

引用

@article{arxiv.2010.04950,
  title  = {A Model Compression Method with Matrix Product Operators for Speech Enhancement},
  author = {Xingwei Sun and Ze-Feng Gao and Zhong-Yi Lu and Junfeng Li and Yonghong Yan},
  journal= {arXiv preprint arXiv:2010.04950},
  year   = {2020}
}

备注

11 pages, 6 figures, 7 tables