LaFurca:基于上下文感知双路径并行双向LSTM的迭代精炼语音分离
声音
2020-10-28 v4 音频与语音处理
摘要
带有双路径双向长短期记忆(BiLSTM)块的深度神经网络已被证明在序列建模中非常有效,尤其在语音分离中,例如 DPRNN-TasNet \cite{luo2019dual}。本文中,我们提出了几种基于双路径 BiLSTM 网络的改进,用于单通道语音分离端到端方法。首先引入具有帧内并行 BiLSTM 与帧间并行 BiLSTM 组件的双路径网络,以降低不同分支间的性能子方差。其次,我们提出使用全局上下文感知的帧间-帧内交叉并行 BiLSTM 来进一步感知全局上下文信息。最后,提出一种螺旋多级双路径 BiLSTM,以迭代地精炼前级的分离结果。所有这些网络均接收两名说话人的混合语音,并将其映射为两条独立语音,每条仅含一名说话人声音。在目标上,我们提出以排列不变训练(PIT)方式直接优化语句级尺度不变信号失真比(SI-SDR)来训练网络。我们在公开 WSJ0-2mix 语料库上的实验取得了 20.55dB SDR 提升、20.35dB SI-SDR 提升、3.69 的 PESQ 以及 94.86% 的 ESTOI,表明所提网络可提升说话人分离任务性能。我们已在 https://github.com/ShiZiqiang/dual-path-RNNs-DPRNNs-based-speech-separation 开源了对 DPRNN-TasNet 的复现,我们的 LaFurca 基于此实现,相信本文结果可轻松复现。
引用
@article{arxiv.2001.08998,
title = {LaFurca: Iterative Refined Speech Separation Based on Context-Aware Dual-Path Parallel Bi-LSTM},
author = {Ziqiang Shi and Rujie Liu and Jiqing Han},
journal= {arXiv preprint arXiv:2001.08998},
year = {2020}
}
备注
arXiv admin note: substantial text overlap with arXiv:1902.04891, arXiv:1902.00651