中文

SkiM:用于低延迟实时连续语音分离的跳跃记忆LSTM

音频与语音处理 2022-02-11 v2 声音

摘要

用于会议预处理的连续语音分离近来已成为一个聚焦的研究课题。与句子级语音分离中的数据相比,会议风格音频流持续时间更长,说话人数量不确定。我们采用时域语音分离方法和近期提出的Graph-PIT来构建一个超低延迟在线语音分离模型,这对实际应用非常重要。具有小步幅的低延迟时域编码器导致极长的特征序列。我们提出了一种名为跳跃记忆(SkiM)的简洁而高效的模型用于长序列建模。实验结果表明,SkiM取得了与DPRNN相当甚至更好的分离性能。同时,SkiM的计算成本相比DPRNN降低了75%。强大的长序列建模能力和低计算成本使SkiM成为在线CSS应用的合适模型。我们最快的实时模型在模拟会议风格评估中以低于1毫秒的延迟取得了17.1 dB信失真比(SDR)提升。

关键词

引用

@article{arxiv.2201.10800,
  title  = {SkiM: Skipping Memory LSTM for Low-Latency Real-Time Continuous Speech Separation},
  author = {Chenda Li and Lei Yang and Weiqin Wang and Yanmin Qian},
  journal= {arXiv preprint arXiv:2201.10800},
  year   = {2022}
}

备注

Accepted by ICASSP 2022