中文

用于长序列数据层次化建模的多路径RNN及其在说话人流分离中的应用

音频与语音处理 2020-06-25 v1 声音

摘要

近年来,基于双路径循环神经网络(DPRNN)的时域音频源分离极大地提升了源分离性能。DPRNN 是一种简单但针对长序列数据有效的模型。虽然 DPRNN 在建模长度为一条语段的序列数据(即约 5 至 10 秒数据)时非常高效,但将其应用于更长的序列(如由多个语段组成的整个对话)则较为困难。这仅仅是因为,在这种情况下,其内部称为块间 RNN 的模块所消耗的时间步数变得极其庞大。为缓解此问题,本文提出多路径 RNN(MPRNN),即 DPRNN 的泛化版本,以层次化方式对输入数据建模。在 MPRNN 框架中,输入数据以若干(>3)时间分辨率表示,每个分辨率由特定的 RNN 子模块建模。例如,处理最细分辨率的 RNN 子模块可能仅建模音素内的时间关系,而处理最粗分辨率的 RNN 子模块可能仅捕捉语段间的关系(如说话人信息)。我们使用模拟的类对话混合信号进行实验,结果表明 MPRNN 具有更大的模型容量,并且尤其在在线处理场景下优于当前最先进的 DPRNN 框架。

关键词

引用

@article{arxiv.2006.13579,
  title  = {Multi-path RNN for hierarchical modeling of long sequential data and its application to speaker stream separation},
  author = {Keisuke Kinoshita and Thilo von Neumann and Marc Delcroix and Tomohiro Nakatani and Reinhold Haeb-Umbach},
  journal= {arXiv preprint arXiv:2006.13579},
  year   = {2020}
}

备注

5 pages, 4 figures