探索以孤立音符作为预训练数据用于复调音乐中主导乐器识别
声音
2023-06-16 v1 音频与语音处理
摘要
随着可用音乐数据量的增长,自动乐器识别作为音乐信息检索(MIR)中的基本问题之一,正受到越来越多的关注。虽然单一乐器的自动识别已得到充分研究,但对于复调、多乐器音乐录音而言仍具挑战性。本工作介绍了我们为复调多乐器音乐构建鲁棒端到端乐器识别系统的努力。我们采用预训练与微调的方法来训练模型:使用大量单声部音乐数据进行预训练,随后对模型进行复调合奏的微调。在预训练中,我们应用数据增强技术以缓解单声部音乐数据与真实世界音乐之间的领域鸿沟。我们在 IRMAS 测试数据(一个由专业制作的商业音乐录音组成的复调音乐数据集)上评估了我们的方法。实验结果表明,我们的最佳模型取得了 0.674 的 micro F1-score 与 0.814 的 LRAP,意味着相较先前最先进的端到端方法分别有 10.9% 与 8.9% 的相对提升。此外,我们能够构建一个轻量级模型,仅以 519K 可训练参数便取得了具竞争力的性能。
引用
@article{arxiv.2306.08850,
title = {Exploring Isolated Musical Notes as Pre-training Data for Predominant Instrument Recognition in Polyphonic Music},
author = {Lifan Zhong and Erica Cooper and Junichi Yamagishi and Nobuaki Minematsu},
journal= {arXiv preprint arXiv:2306.08850},
year = {2023}
}
备注
Submitted to APSIPA 2023