BASS:面向音乐结构与语义推理的音频语言模型基准测试
声音
2026-02-05 v1 计算与语言
摘要
音乐理解是一项复杂任务,往往需要对音频的结构和语义元素进行推理。我们提出BASS基准测试,旨在评估音频语言模型在音乐理解与推理方面的能力,涵盖四大类别:结构分段、歌词转录、音乐学分析和艺术家合作。BASS包含2658个问题,覆盖12项任务,1993首独立歌曲,总时长超过138小时的音乐,来源广泛,旨在评估音乐学知识与推理在真实场景中的表现。我们评估了14个开源及前沿多模态语言模型,发现即使是最先进的模型在结构分段和艺术家合作等高阶推理任务上仍表现不足,歌词转录表现最佳。我们的分析表明,当前模型有效利用语言先验,但在对音乐结构、人声和音乐学属性进行推理方面仍受限。BASS为音乐推荐和搜索提供了广泛应用的评估框架,并能指导音频语言模型的发展。
引用
@article{arxiv.2602.04085,
title = {BASS: Benchmarking Audio LMs for Musical Structure and Semantic Reasoning},
author = {Min Jang and Orevaoghene Ahia and Nazif Tamer and Sachin Kumar and Yulia Tsvetkov and Noah A. Smith},
journal= {arXiv preprint arXiv:2602.04085},
year = {2026}
}