中文

EDMFormer:面向音乐结构分割的主题域自监督学习

声音 2026-03-11 v1 人工智能

摘要

音乐结构分割是音频分析中的关键任务,但现有模型在电子舞曲 (EDM) 上表现不佳。这种问题源于大多数方法依赖歌词或和声相似性,这些方法对流行音乐有效,但对 EDM 无效。EDM 的结构取决于能量、节奏和 timbre 的变化,包含 buildup、drop 和 breakdown 等不同章节。我们提出 EDMFormer,一种结合了自监督音频嵌入的转换器模型,并使用特定于 EDM 的数据集和分类学。我们将该数据集发布为 EDM-98:一组 98 个专业标注的 EDM 曲目。EDMFormer 在边界检测和章节标注方面优于现有模型,尤其在 drop 和 buildup 上。结果表明,结合所学表示与特定于作品的数据和结构先验对于 EDM 以及其他特定音乐类型或更广泛的音频领域是有效的。

关键词

引用

@article{arxiv.2603.08759,
  title  = {EDMFormer: Genre-Specific Self-Supervised Learning for Music Structure Segmentation},
  author = {Sahal Sajeer and Krish Patel and Oscar Chung and Joel Song Bae},
  journal= {arXiv preprint arXiv:2603.08759},
  year   = {2026}
}

备注

Published in CUCAI 2026 conference proceedings