基于多阶段精细化双路径深度双向LSTM及辅助身份损失的语音分离
音频与语音处理
2020-08-10 v1 声音
摘要
带有双路径双向长短期记忆(BiLSTM)块的深度神经网络已被证明在序列建模中非常有效,尤其在语音分离中。本工作研究如何扩展双路径BiLSTM,从而得到一种称为TasTas的新的最先进方法,用于多说话人单通道语音分离(即鸡尾酒会问题)。TasTas引入了两个简单但有效的改进,其一是迭代多阶段精炼方案,其二是通过分离语音与原始语音之间说话人身份一致性的损失来校正分离不完美的语音,以提升基于双路径BiLSTM的网络性能。TasTas接收两个说话人的混合语音并将其映射为两个分离语音,其中每个语音仅包含一个说话人的声音。我们在著名的基准WSJ0-2mix语料库上的实验取得了20.55dB的SDR提升、20.35dB的SI-SDR提升、3.69的PESQ以及94.86\%的ESTOI,表明我们所提出的网络能在说话人分离任务上带来大幅性能提升。我们已在此处开源了DPRNN-TasNet的重新实现(https://github.com/ShiZiqiang/dual-path-RNNs-DPRNNs-based-speech-separation),而我们的TasTas基于此DPRNN-TasNet实现,相信本文结果可轻松复现。
引用
@article{arxiv.2008.03149,
title = {Speech Separation Based on Multi-Stage Elaborated Dual-Path Deep BiLSTM with Auxiliary Identity Loss},
author = {Ziqiang Shi and Rujie Liu and Jiqing Han},
journal= {arXiv preprint arXiv:2008.03149},
year = {2020}
}
备注
To appear in Interspeech 2020. arXiv admin note: substantial text overlap with arXiv:2001.08998, arXiv:1902.04891, arXiv:1902.00651