用于单通道语音增强的张量列长短期记忆网络
声音
2018-12-27 v1 机器学习
音频与语音处理
摘要
近年来,长短期记忆(Long Short-Term Memory, LSTM)已成为语音分离与语音增强任务的热门选择。LSTM 网络的能力可通过加宽和增加层数来增强。然而,这会在网络中引入数百万参数,并增加计算资源需求。这些限制阻碍了 RNN 模型在手机和内存受限嵌入式系统等低端设备上的高效实现。为克服这些问题,我们提出一种高效的替代方法,基于张量列(Tensor-Train, TT)格式表示 LSTM 的权重矩阵参数以减少参数量。我们将此张量列因子化 LSTM 称为 TT-LSTM 模型。基于该 TT-LSTM 单元,我们提出了一种用于单通道语音增强任务的深度 TensorNet 模型。在各种测试条件及标准语音质量与可懂度指标下的实验结果表明,所提出的基于深度 TT-LSTM 的语音增强框架即使模型架构复杂度低数个数量级,仍能与最先进的未压缩 RNN 模型取得相当的性能。
引用
@article{arxiv.1812.10095,
title = {Tensor-Train Long Short-Term Memory for Monaural Speech Enhancement},
author = {Suman Samui and Indrajit Chakrabarti and Soumya K. Ghosh},
journal= {arXiv preprint arXiv:1812.10095},
year = {2018}
}
备注
Submitted to IEEE Signal Processing Letters