中文

SongFormer:基于异构监督的音乐结构分析规模化框架

音频与语音处理 2026-04-09 v3

摘要

音乐结构分析 (MSA) 为音乐理解和可控生成提供基础,但进展受限于小规模且一致性不足的语料库。我们提出 SongFormer,一个可从异构监督中学习的可扩展框架。SongFormer (i) 融合短窗口和长窗口的自监督学习表征,以捕获细粒度和长程依赖;(ii) 引入 learned source embedding,使模型能够使用部分、噪声且模式不匹配的标签进行训练。为支持规模化和公平评估,我们发布了 SongFormDB——目前最大的 MSA 语料库(超过 14000 首歌曲,涵盖多种语言和流派),以及 SongFormBench——一个 300 首经专家验证的基准数据集。在 SongFormBench 上,SongFormer 在严格边界检测 (HR.5F) 上取得了新的最佳成绩,实现了最高的功能标签准确率,同时保持计算效率;它在这些指标上超越了强大基线和 Gemini 2.5 Pro,并在宽松容忍 (HR3F) 下保持竞争力。代码、数据集和模型已开源于 https://github.com/ASLP-lab/SongFormer。

关键词

引用

@article{arxiv.2510.02797,
  title  = {SongFormer: Scaling Music Structure Analysis with Heterogeneous Supervision},
  author = {Chunbo Hao and Ruibin Yuan and Jixun Yao and Qixin Deng and Xinyi Bai and Yanbo Wang and Wei Xue and Lei Xie},
  journal= {arXiv preprint arXiv:2510.02797},
  year   = {2026}
}