中文

MelodyGLM:面向符号旋律生成的多任务预训练

声音 2023-09-21 v2 人工智能 计算与语言 信息检索 多媒体 音频与语音处理

摘要

预训练语言模型已在多种音乐理解与生成任务中取得令人印象深刻的成果。然而,现有的符号旋律生成预训练方法由于文本与音乐间的领域知识差异,难以捕捉音符序列中的多尺度、多维结构信息。此外,缺乏可用的大规模符号旋律数据集限制了预训练的提升。本文提出MelodyGLM,一种用于生成长程结构旋律的多任务预训练框架。我们设计旋律n-gram与长跨度采样策略,构建局部与全局空白填充任务以建模旋律中的局部与全局结构。具体而言,我们将音高n-gram、节奏n-gram及其组合n-gram纳入旋律n-gram空白填充任务,以建模旋律中的多维结构。为此,我们构建了包含逾40万条旋律片段的大规模符号旋律数据集MelodyNet。MelodyNet用于大规模预训练与领域特定n-gram词典构建。主客观评测均表明MelodyGLM超越标准及既往预训练方法。特别地,主观评测显示,在旋律续写任务上,MelodyGLM在一致性、节奏性、结构性与整体质量上分别平均提升0.82、0.87、0.78与0.94。值得注意的是,在旋律修复任务上,MelodyGLM几乎匹配人类创作旋律的质量。

关键词

引用

@article{arxiv.2309.10738,
  title  = {MelodyGLM: Multi-task Pre-training for Symbolic Melody Generation},
  author = {Xinda Wu and Zhijie Huang and Kejun Zhang and Jiaxing Yu and Xu Tan and Tieyao Zhang and Zihao Wang and Lingyun Sun},
  journal= {arXiv preprint arXiv:2309.10738},
  year   = {2023}
}