加速用于源分离的排列不变训练
音频与语音处理
2021-08-02 v1 声音
摘要
排列不变训练(PIT)是基于神经网络的源分离中广泛使用的训练准则,既用于带有语句级 PIT(uPIT)的语句级分离,也用于近期提出的 Graph-PIT 对长录音的分离。当朴素实现时,两者在待分离语句数量上均具有指数级复杂度,导致其在大量说话人或长真实录音下无法使用。我们提出将 PIT 准则分解为一个矩阵的计算和一个严格单调递增函数,从而可利用若干搜索算法高效求解排列或分配问题。匈牙利算法可用于 uPIT,我们为 Graph-PIT 分配问题引入多种算法,将复杂度降低为关于语句数量的多项式级。
引用
@article{arxiv.2107.14445,
title = {Speeding Up Permutation Invariant Training for Source Separation},
author = {Thilo von Neumann and Christoph Boeddeker and Keisuke Kinoshita and Marc Delcroix and Reinhold Haeb-Umbach},
journal= {arXiv preprint arXiv:2107.14445},
year = {2021}
}
备注
Accepted at 14th ITG Conference on Speech Communication