中文

音乐生成模型是否编码音乐理论?

声音 2024-10-02 v1 人工智能 计算与语言 机器学习 音频与语音处理

摘要

音乐基础模型拥有强大的音乐生成能力。作曲时,人们可能会通过使用音符和音程来构建旋律、使用和弦来构建和弦进行、以及运用节拍来创造节奏感,从而向作品中注入对音乐的理解。这些说法在音乐生成模型中是否成立?更具体地说,西方音乐理论的基本概念是否可在这些模型的“内部工作”中观察到?最近的研究提出了利用音乐生成模型中的潜在音频表示来实现音乐信息检索任务(例如风格分类、情感识别),这表明这些模型中编码了高层次的音乐特征。然而,对单个音乐理论概念(例如节拍、音阶、和弦质量)的探测仍在不足之处。因此,我们引入了 SynTheory,一个由节拍、小节拍号、音符、音程、音阶、和弦和和弦进行等概念构成的合成 MIDI 和音频音乐理论数据集。随后,我们提出了一种框架来探测音乐基础模型(Jukebox 和 MusicGen)中的这些音乐理论概念,并评估它们在内部表示中编码这些概念的强度。我们的发现表明,音乐理论概念在基础模型中是可辨识的,并且它们被检测到的程度因模型大小和层数而异。

关键词

引用

@article{arxiv.2410.00872,
  title  = {Do Music Generation Models Encode Music Theory?},
  author = {Megan Wei and Michael Freeman and Chris Donahue and Chen Sun},
  journal= {arXiv preprint arXiv:2410.00872},
  year   = {2024}
}

备注

Accepted at ISMIR 2024. Dataset: https://huggingface.co/datasets/meganwei/syntheory Code: https://github.com/brown-palm/syntheory Website: https://brown-palm.github.io/music-theory