中文

迈向同时聆听10人:基于Sinkhorn算法的高效置换不变音频源分离训练

声音 2021-05-18 v2 机器学习 音频与语音处理

摘要

在基于神经网络的单通道语音分离技术中,近来使用置换不变训练(PIT)损失来评估损失已十分常见。然而,普通PIT需要尝试N个真值与N个估计之间的所有N!N!种置换。由于阶乘复杂度随NN增大而极快爆炸,基于PIT的训练仅在源信号数量较少(如N=2N = 233)时可行。为克服此限制,本文提出SinkPIT,一种PIT损失的新变体,当NN较大时比普通PIT损失高效得多。SinkPIT基于Sinkhorn矩阵平衡算法,该算法以可微分方式高效寻找一个双随机矩阵来逼近最优置换。作者进行了实验,使用SinkPIT训练神经网络模型将单通道混合信号分解为10个源,并获得了有前景的结果。

关键词

引用

@article{arxiv.2010.11871,
  title  = {Towards Listening to 10 People Simultaneously: An Efficient Permutation Invariant Training of Audio Source Separation Using Sinkhorn's Algorithm},
  author = {Hideyuki Tachibana},
  journal= {arXiv preprint arXiv:2010.11871},
  year   = {2021}
}

备注

5 pages, 8 figures, IEEE ICASSP 2021