中文

关于免费通用声音分离数据(FUSS)的一切喧哗为何?

声音 2020-11-03 v1 音频与语音处理

摘要

我们介绍了免费通用声音分离(FUSS)数据集,这是一个用于从开放领域声音类型中分离未知数量声音混合物的新语料库。该数据集包含来自 357 个类别的 23 小时单源音频数据,用于创建一到四个声源的混合。为模拟混响,使用声学房间模拟器生成具有频率相关反射墙壁的盒形房间的脉冲响应。还提供了额外的开源数据增强工具,以产生具有不同声源和房间模拟组合的新混合物。最后,我们介绍了一个开源的基线分离模型,基于改进的时间域卷积网络(TDCN++),能够分离混合物中可变数量的声源。该模型在二到四个声源的混合物上实现了 9.8 dB 的尺度不变信噪比改善(SI-SNRi),同时在单源输入重建上达到 35.5 dB 的绝对 SI-SNR。我们希望该数据集能降低新研究的门槛,并允许从其他机器学习领域快速迭代和应用新技术于声音分离挑战。

关键词

引用

@article{arxiv.2011.00803,
  title  = {What's All the FUSS About Free Universal Sound Separation Data?},
  author = {Scott Wisdom and Hakan Erdogan and Daniel Ellis and Romain Serizel and Nicolas Turpault and Eduardo Fonseca and Justin Salamon and Prem Seetharaman and John Hershey},
  journal= {arXiv preprint arXiv:2011.00803},
  year   = {2020}
}