LSTM-RNN 中用于源分离的记忆力分析
音频与语音处理
2020-09-02 v1 声音
摘要
长短期记忆循环神经网络(LSTM-RNNs)被视为许多语音处理任务中的最先进水平。网络中的循环原则上允许任意输入被无限期记住,这一特征对诸如语音之类的序列数据非常有用。然而,关于 LSTM 中实际存储了哪些信息以及存储多久,人们所知甚少。我们通过采用一种记忆重置方法来解决该问题,其使我们能够根据所允许的记忆时间跨度评估网络性能。我们将此方法应用于多说话人源分离任务,但其可用于任何使用 RNN 的任务。我们发现短期(短于 100 毫秒)语言处理过程具有强烈的性能效应。仅有说话人特征在记忆中被保持超过 400 毫秒。此外,我们确认从性能角度看,在更深层中实现更长记忆已足够。最后,在双向模型中,反向模型对分离性能的贡献略高于前向模型。
引用
@article{arxiv.2009.00551,
title = {Analysis of memory in LSTM-RNNs for source separation},
author = {Jeroen Zegers and Hugo Van hamme},
journal= {arXiv preprint arXiv:2009.00551},
year = {2020}
}