稀疏、高效且语义化的混合不变训练:驯服野外部无监督声音分离
音频与语音处理
2021-10-19 v2 声音
摘要
有监督神经网络训练在单通道声音分离上取得了显著进展。该方法依赖真实孤立源,这阻碍了向广泛可用的混合数据扩展,并限制了在开放域任务上的进展。近期的混合不变训练(MixIT)方法支持在野外部数据上训练;然而,它存在两个突出问题。首先,它产生的模型往往过度分离,输出源数量多于输入中存在的源。其次,MixIT损失的指数级计算复杂度限制了可行输出源的数量。本文同时解决这两个问题。为抑制过度分离,我们引入新损失:偏好更少输出源的稀疏性损失,以及抑制相关输出的协方差损失。我们还通过预测每个混合的弱类别标签试验了语义分类损失。为处理更大量源数,我们引入一种使用快速最小二乘解并投影到MixIT约束集上的高效近似。我们的实验表明,所提损失遏制了过度分离并提升了整体性能。最佳性能通过使用更多输出源实现,这得益于我们高效的MixIT损失,并结合稀疏性损失防止过度分离。在FUSS测试集上,我们实现了多源SI-SNR提升超过13 dB,同时将单源重建SI-SNR提升超过17 dB。
引用
@article{arxiv.2106.00847,
title = {Sparse, Efficient, and Semantic Mixture Invariant Training: Taming In-the-Wild Unsupervised Sound Separation},
author = {Scott Wisdom and Aren Jansen and Ron J. Weiss and Hakan Erdogan and John R. Hershey},
journal= {arXiv preprint arXiv:2106.00847},
year = {2021}
}
备注
5 pages, 1 figure. WASPAA 2021