基于深度循环神经网络的话语级排列不变训练的多说话人语音分离
声音
2018-12-06 v2 机器学习
音频与语音处理
摘要
本文提出了话语级排列不变训练(uPIT)技术。uPIT 是一种实用可行的、端到端的、基于深度学习的解决方案,用于说话人无关的多说话人语音分离。具体而言,uPIT 扩展了最近提出的排列不变训练(PIT)技术,采用话语级代价函数,从而消除了在推理过程中解决额外排列问题的需要,而帧级 PIT 则需要进行该步骤。我们利用循环神经网络(RNNs)来实现这一点,在训练过程中最小化话语级分离误差,从而迫使属于同一说话人的分离帧对齐到同一输出流。在实践中,这使得经过 uPIT 训练的 RNNs 能够在没有任何信号时长、说话人数量、说话人身份或性别先验知识的情况下,分离多说话人混合语音。我们在 WSJ0 和丹麦语的双人及三人混合语音分离任务上评估了 uPIT,发现 uPIT 优于基于非负矩阵分解(NMF)和计算听觉场景分析(CASA)的技术,并与深度聚类(DPCL)和深度吸引子网络(DANet)相比具有竞争力。此外,我们发现用 uPIT 训练的模型能很好地泛化到未见过的说话人和语言。最后,我们发现一个用 uPIT 训练的单一模型可以同时处理双说话人和三说话人的语音混合。
引用
@article{arxiv.1703.06284,
title = {Multi-talker Speech Separation with Utterance-level Permutation Invariant Training of Deep Recurrent Neural Networks},
author = {Morten Kolbæk and Dong Yu and Zheng-Hua Tan and Jesper Jensen},
journal= {arXiv preprint arXiv:1703.06284},
year = {2018}
}