中文

为预训练无条件音乐 Transformer 赋予乐器与流派控制能力

声音 2023-11-22 v1 信息检索 多媒体 音频与语音处理

摘要

“预训练—微调”范式已成为自然语言处理与计算机视觉中训练领域特定模型的规范。在这项工作中,我们旨在通过利用源自 MuseScore 论坛的有史以来最大的符号音乐数据集,来检验这一范式在符号音乐生成中的适用性。我们首先使用 150 万首歌曲预训练了一个大型无条件 transformer 模型。然后,我们提出了一种简单技术,通过用额外的控制词元微调该预训练无条件音乐 transformer 模型,为其赋予乐器与流派控制能力。相较于两种现有表示,我们所提出的表示提供了改进的高层可控性与表现力。实验结果表明,所提出的模型能成功生成具有用户指定乐器与流派的音乐。在主观听感测试中,所提模型在连贯性、和声、编配与整体质量方面优于预训练基线模型。

关键词

引用

@article{arxiv.2311.12257,
  title  = {Equipping Pretrained Unconditional Music Transformers with Instrument and Genre Controls},
  author = {Weihan Xu and Julian McAuley and Shlomo Dubnov and Hao-Wen Dong},
  journal= {arXiv preprint arXiv:2311.12257},
  year   = {2023}
}