基于结构嵌入的大型语言模型实用可复现符号化音乐生成
声音
2024-07-30 v1 人工智能
音频与语音处理
摘要
音乐生成为大型语言模型带来了挑战性的复杂性。符号化音乐结构通常包括垂直和声化以及水平对位,迫使大规模 Transformer 进行各种改编和增强。然而,现有工作存在三个主要缺陷:1) 其分词要求特定领域的注释,例如小节和节拍,这些通常缺失于原始 MIDI 数据中;2) 在没有特定领域注释的情况下,仅检验增强 token 嵌入方法的纯影响几乎不可能;3) 为了克服上述缺陷(如 MuseNet),现有工作缺乏可复现性。为此,我们发展了一个基于 MIDI 的音乐生成框架,受 MuseNet 启发,经验性地研究了两种不依赖特定领域注释的结构嵌入。我们提供了各种指标和见解,可指导合适的编码部署。我们还验证了多种嵌入配置可选择性地提升某些音乐方面。通过在 HuggingFace 提供开源实现,我们的发现为利用大型语言模型实现实用且可复现的音乐生成指明了方向。
引用
@article{arxiv.2407.19900,
title = {Practical and Reproducible Symbolic Music Generation by Large Language Models with Structural Embeddings},
author = {Seungyeon Rhyu and Kichang Yang and Sungjun Cho and Jaehyeon Kim and Kyogu Lee and Moontae Lee},
journal= {arXiv preprint arXiv:2407.19900},
year = {2024}
}
备注
9 pages, 6 figures, 4 tables