GETMusic:以统一表示与扩散框架生成任意音轨
声音
2023-10-02 v2 机器学习
多媒体
音频与语音处理
摘要
符号音乐生成旨在创作音符,可帮助用户作曲,例如基于提供的源音轨生成目标乐器音轨。在存在预定义音轨组合及多样作曲需求的实际场景中,一个能基于其他音轨生成任意目标音轨的高效且有效的生成模型变得至关重要。然而,先前工作因其音乐表示与模型的局限,未能满足该需求。本文引入一个名为 GETMusic 的框架,其中“GET”代表“GEnerate music Tracks(生成音乐音轨)”。该框架包含新颖音乐表示“GETScore”与扩散模型“GETDiff”。GETScore 将音符表示为词元,并以二维结构组织词元:音轨纵向堆叠,随时间横向推进。在训练步中,一首乐曲的每个音轨被随机选为目标或源。训练包含两过程:前向过程中,目标音轨通过其词元被掩码而损坏,源音轨保持为真值;去噪过程中,训练 GETDiff 基于源音轨预测被掩码的目标词元。我们所提表示与非自回归生成模型相结合,使 GETMusic 能以任意源-目标音轨组合生成音乐。实验表明,多功能的 GETMusic 优于针对某些特定作曲任务提出的已有工作。
引用
@article{arxiv.2305.10841,
title = {GETMusic: Generating Any Music Tracks with a Unified Representation and Diffusion Framework},
author = {Ang Lv and Xu Tan and Peiling Lu and Wei Ye and Shikun Zhang and Jiang Bian and Rui Yan},
journal= {arXiv preprint arXiv:2305.10841},
year = {2023}
}
备注
13 pages, 4 figures