OMAR-RQ:基于多特征掩码标记预测训练的开源音乐音频表示模型
声音
2025-07-08 v1 音频与语音处理
摘要
开发开源基础模型对于推进音乐音频理解研究以及确保为音乐信息检索提供强大、多用途的表示至关重要。我们提出了 OMAR-RQ,这是一个通过掩码标记分类方法进行自监督训练的模型,使用了包含超过 33 万小时音乐音频的大规模数据集。我们尝试了不同的输入特征和量化选项,并在音乐标注、音高估计、和弦识别、节拍跟踪、分割和难度估计方面,在开源自监督模型中达到了最先进的性能。我们开源了训练和评估流程以及模型权重,可在 https://github.com/mtg/omar-rq 获取。
引用
@article{arxiv.2507.03482,
title = {OMAR-RQ: Open Music Audio Representation Model Trained with Multi-Feature Masked Token Prediction},
author = {Pablo Alonso-Jiménez and Pedro Ramoneda and R. Oguz Araz and Andrea Poltronieri and Dmitry Bogdanov},
journal= {arXiv preprint arXiv:2507.03482},
year = {2025}
}