中文

使用混合不变训练的无监督声音分离

音频与语音处理 2020-10-27 v2 机器学习 声音

摘要

近年来,利用深度神经网络监督训练的单通道声音分离问题取得了快速进展。在此类监督方法中,模型通过预测由孤立真值源相加构成的合成混合物的分量源来进行训练。对这种合成训练数据的依赖是有问题的,因为良好性能取决于训练数据与真实世界音频的匹配程度,尤其在声学条件和源分布方面。声学特性可能难以准确模拟,且声音类型的分布可能难以复制。在本文中,我们提出一种完全无监督的方法——混合不变训练(MixIT),其仅需单通道声学混合物。在MixIT中,训练样本通过将现有混合物混合在一起构建,模型将其分离为可变数量的潜在源,使得分离出的源可重新混合以逼近原始混合物。我们表明,MixIT在语音分离上可与监督方法取得竞争性性能。在半监督学习设置中使用MixIT可实现无监督域适应并从大量真实世界数据中学习而无需真值源波形。特别地,我们通过引入混响混合物显著改善了混响语音分离性能,从含噪混合物训练了语音增强系统,并通过引入大量野外数据改善了通用声音分离。

关键词

引用

@article{arxiv.2006.12701,
  title  = {Unsupervised Sound Separation Using Mixture Invariant Training},
  author = {Scott Wisdom and Efthymios Tzinis and Hakan Erdogan and Ron J. Weiss and Kevin Wilson and John R. Hershey},
  journal= {arXiv preprint arXiv:2006.12701},
  year   = {2020}
}

备注

Accepted for spotlight presentation at NeurIPS 2020