Jointist:通过联合训练同时改进多乐器转写与音乐源分离
声音
2023-02-03 v2 人工智能
机器学习
音频与语音处理
摘要
在本文中,我们介绍了 Jointist,一个乐器感知的多乐器框架,能够从音频片段中转录、识别并分离多种乐器。Jointist 由一个乐器识别模块构成,该模块为另外两个模块提供条件:一个输出乐器特定钢琴卷帘(piano roll)的转录模块,以及一个利用乐器信息与转录结果的源分离模块。转录模块与源分离模块的联合训练有助于提升两项任务的性能。乐器模块是可选的,并且可由人类用户直接控制。这使得 Jointist 成为一个灵活的用户可控框架。我们具有挑战性的问题表述使该模型在现实世界中非常有用,因为现代流行音乐通常由多种乐器组成。然而,其新颖性需要从新的视角来评估此类模型。在我们的实验中,我们从多个方面评估所提出的模型,为多乐器转写提供了一种新的评估视角。我们的主观听音研究表明,Jointist 在流行音乐上达到了最先进的性能,优于现有的多乐器转写模型如 MT3。我们在若干下游任务上进行了实验,发现当利用 Jointist 获得的转录结果时,所提方法使转写提升超过 1 个百分点(ppt.),源分离提升 5 SDR,下拍检测提升 1.8 ppt.,和弦识别提升 1.4 ppt.,以及调性估计提升 1.4 ppt.。演示见 \url{https://jointist.github.io/Demo}。
引用
@article{arxiv.2302.00286,
title = {Jointist: Simultaneous Improvement of Multi-instrument Transcription and Music Source Separation via Joint Training},
author = {Kin Wai Cheuk and Keunwoo Choi and Qiuqiang Kong and Bochen Li and Minz Won and Ju-Chiang Wang and Yun-Ning Hung and Dorien Herremans},
journal= {arXiv preprint arXiv:2302.00286},
year = {2023}
}
备注
arXiv admin note: text overlap with arXiv:2206.10805