MARBLE:面向通用评估的音乐音频表征基准
声音
2023-11-27 v4 人工智能
机器学习
音频与语音处理
摘要
在艺术与人工智能(AI)广泛交融的时代,例如图像生成与小说协同创作,音乐领域的 AI 仍相对 nascent,尤其在音乐理解方面。这体现在深度音乐表征工作的有限、大规模数据集的匮乏,以及通用且社区驱动的基准的缺失。为解决此问题,我们引入了面向通用评估的音乐音频表征基准(Music Audio Representation Benchmark for universaL Evaluation),简称 MARBLE。它旨在通过定义包含声学、演奏、乐谱与高层描述四个层级层次的全面分类体系,为各类音乐信息检索(MIR)任务提供基准。我们随后基于 8 个公开数据集上的 14 项任务建立统一协议,对所有在音乐录音上开发的开放源代码预训练模型的表征作为基线进行公平、标准的评估。此外,MARBLE 为社区提供了一个易用、可扩展且可复现的套件,并明确声明了数据集的版权问题。结果表明,近期提出的大规模预训练音乐语言模型在大多数任务中表现最佳,但仍有进一步改进空间。排行榜与工具库发布于 https://marble-bm.shef.ac.uk,以推动未来的音乐 AI 研究。
引用
@article{arxiv.2306.10548,
title = {MARBLE: Music Audio Representation Benchmark for Universal Evaluation},
author = {Ruibin Yuan and Yinghao Ma and Yizhi Li and Ge Zhang and Xingran Chen and Hanzhi Yin and Le Zhuo and Yiqi Liu and Jiawen Huang and Zeyue Tian and Binyue Deng and Ningzhi Wang and Chenghua Lin and Emmanouil Benetos and Anton Ragni and Norbert Gyenge and Roger Dannenberg and Wenhu Chen and Gus Xia and Wei Xue and Si Liu and Shi Wang and Ruibo Liu and Yike Guo and Jie Fu},
journal= {arXiv preprint arXiv:2306.10548},
year = {2023}
}
备注
camera-ready version for NeurIPS 2023