中文

基于最优排列训练的多说话人单通道语音分离

声音 2021-11-09 v4 人工智能 机器学习 音频与语音处理

摘要

单通道语音分离在过去几年中取得了巨大进展。然而,当前的训练方法依赖于排列不变损失(Permutation Invariant Loss, PIT),难以训练用于大量说话人(例如超过10人)的神经语音分离模型。在本工作中,我们提出了一种排列不变训练方法,采用匈牙利算法,使得训练的时间复杂度为 O(C3)O(C^3)(其中 CC 为说话人数量),而基于 PIT 的方法为 O(C!)O(C!)。此外,我们提出了一种改进的网络架构,能够处理增多的说话人数量。我们的方法可分离多达 2020 名说话人,并在大 CC 情况下大幅改进了先前的结果。

关键词

引用

@article{arxiv.2104.08955,
  title  = {Many-Speakers Single Channel Speech Separation with Optimal Permutation Training},
  author = {Shaked Dovrat and Eliya Nachmani and Lior Wolf},
  journal= {arXiv preprint arXiv:2104.08955},
  year   = {2021}
}

备注

Accepted to Interspeech 2021, Data creation link added