基于深度学习的多类音乐源分离的快速精度估计
声音
2021-12-02 v3 机器学习
音频与语音处理
摘要
音乐源分离是指从给定歌曲中提取所有乐器的任务。近期该挑战的突破围绕单一数据集 MUSDB 展开,其仅局限于四类乐器。更大的数据集和更多乐器在数据收集和深度神经网络(DNN)训练方面成本高且耗时。在本工作中,我们提出一种无需训练和调优 DNN 即可快速评估任意数据集中乐器可分离性的方法。该可分离性度量有助于选择合适的样本以高效训练神经网络。基于带有理想比率掩码(ideal ratio mask)的预言机原理,我们的方法是估计 TasNet 或 Open-Unmix 等最先进深度学习分离性能的优秀代理。我们的结果有助于揭示音频源分离的两个要点:1)理想比率掩码虽轻量直接,却能提供近期神经网络的音频可分离性性能的准确度量;2)诸如 Tasnet 等直接在波形上运算的新端到端学习方法,实际上内部构建了时频(TF)表示,因此在分离 TF 平面中重叠的音频模式时遇到与基于 TF 的方法相同的局限。
引用
@article{arxiv.2010.09453,
title = {Fast accuracy estimation of deep learning based multi-class musical source separation},
author = {Alexandru Mocanu and Benjamin Ricaud and Milos Cernak},
journal= {arXiv preprint arXiv:2010.09453},
year = {2021}
}