迈向同时聆听10人:基于Sinkhorn算法的高效置换不变音频源分离训练
声音
2021-05-18 v2 机器学习
音频与语音处理
摘要
在基于神经网络的单通道语音分离技术中,近来使用置换不变训练(PIT)损失来评估损失已十分常见。然而,普通PIT需要尝试N个真值与N个估计之间的所有种置换。由于阶乘复杂度随增大而极快爆炸,基于PIT的训练仅在源信号数量较少(如或)时可行。为克服此限制,本文提出SinkPIT,一种PIT损失的新变体,当较大时比普通PIT损失高效得多。SinkPIT基于Sinkhorn矩阵平衡算法,该算法以可微分方式高效寻找一个双随机矩阵来逼近最优置换。作者进行了实验,使用SinkPIT训练神经网络模型将单通道混合信号分解为10个源,并获得了有前景的结果。
引用
@article{arxiv.2010.11871,
title = {Towards Listening to 10 People Simultaneously: An Efficient Permutation Invariant Training of Audio Source Separation Using Sinkhorn's Algorithm},
author = {Hideyuki Tachibana},
journal= {arXiv preprint arXiv:2010.11871},
year = {2021}
}
备注
5 pages, 8 figures, IEEE ICASSP 2021