中文

LSTM 在多说话人源分离中的记忆时间跨度

机器学习 2018-08-27 v1 机器学习

摘要

随着深度学习方法在许多语音(以及非语音)相关的机器学习任务中成为最先进水平,人们努力深入探究常被视为黑盒的神经网络。本文通过分析长短期记忆(LSTM)单元中相关记忆时间跨度,研究循环神经网络(RNN)如何处理时间依赖关系。具体做法是对状态变量施加可控生命周期的泄漏并评估任务性能。该技术可用于任何任务,以估计 LSTM 在该特定场景中所利用的时间跨度。本文聚焦于从重叠语音中分离说话人的任务。我们辨别出两种效应:一种长期效应,可能源于说话人特征刻画;一种短期效应,可能利用了音素尺度的共振峰轨迹。

关键词

引用

@article{arxiv.1808.08097,
  title  = {Memory Time Span in LSTMs for Multi-Speaker Source Separation},
  author = {Jeroen Zegers and Hugo Van hamme},
  journal= {arXiv preprint arXiv:1808.08097},
  year   = {2018}
}