利用声音分类改进通用声音分离
声音
2021-05-14 v1 机器学习
音频与语音处理
机器学习
摘要
深度学习方法近期在音频源分离和声音分类方面均取得了令人印象深刻的性能。大多数音频源分离方法仅关注分离属于受限源类域(如语音和音乐)的源。然而,近期工作展示了“通用声音分离”的可能性,其旨在从开放域中分离声学源,而不论其类别。本文中,我们利用在大量多样声音上训练的声音分类器网络所学到的语义信息来改进通用声音分离。具体而言,我们表明从声音分类器提取的语义嵌入可用于调节分离网络,为其提供有用的附加信息。该方法在迭代设置中尤为有用,其中初始分离阶段的源估计及其对应的分类器导出的嵌入被输入到第二个分离网络。通过执行包含逾千次实验的彻底超参数搜索,我们发现来自干净源的分类器嵌入提供了近 1 dB 的 SNR 增益,且我们最佳的迭代模型实现了该预言性能的可观部分,确立了通用声音分离的新 SOTA。
引用
@article{arxiv.1911.07951,
title = {Improving Universal Sound Separation Using Sound Classification},
author = {Efthymios Tzinis and Scott Wisdom and John R. Hershey and Aren Jansen and Daniel P. W. Ellis},
journal= {arXiv preprint arXiv:1911.07951},
year = {2021}
}