中文

音乐中的“单词”发现:符号化音乐的组合稀疏编码无监督学习

声音 2025-09-30 v1 计算机视觉与模式识别

摘要

本文提出了一种无监督机器学习算法,用于从符号化音乐数据中识别重复出现的模式——称为“音乐-单词”。这些模式是音乐结构的基本要素,反映了与创作有关的认知过程。然而,由于音乐解释中固有的语义歧义,提取这些模式仍然具有挑战性。我们将音乐-单词发现任务形式化为统计优化问题,提出一种基于两阶段期望最大化(EM)学习框架:1. 构建音乐-单词词典;2. 重构音乐数据。我们在人类专家注释与算法结果上进行评估,实现了 0.61 的交并比(IoU)得分。我们的发现表明,最小化编码长度有效地解决了语义歧义,表明人类对编码系统的优化塑造了音乐语义。该方法使计算机能够从音乐数据中提取“基本构件”,以促进结构分析和稀疏编码。该方法的两个主要应用场景:其一,在 AI 音乐中支持生成、分类、风格迁移和即兴演奏等下游任务;其二,在音乐学研究中,提供分析作曲模式的工具,洞察不同音乐风格和作曲家中最小编码原则。

关键词

引用

@article{arxiv.2509.24603,
  title  = {Discovering "Words" in Music: Unsupervised Learning of Compositional Sparse Code for Symbolic Music},
  author = {Tianle Wang and Sirui Zhang and Xinyi Tong and Peiyang Yu and Jishang Chen and Liangke Zhao and Xinpu Gao and Yves Zhu and Tiezheng Ge and Bo Zheng and Duo Xu and Yang Liu and Xin Jin and Feng Yu and Songchun Zhu},
  journal= {arXiv preprint arXiv:2509.24603},
  year   = {2025}
}