中文

为何需要扰动符号音乐:通过联合概率扩散模型拟合从未使用的音符分布

声音 2024-08-06 v1 计算与语言 音频与语音处理

摘要

现有的音乐生成模型大多基于语言模型,忽略了音符频率连续性属性,导致对稀有或未使用的音符拟合不足,从而降低生成样本的多样性。我们认为,音符的分布可以由平移不变性和周期性来建模,尤其是通过扩散模型注入频域高斯噪声来泛化音符。然而,由于音乐符号的稀疏性,估计潜在于高密度解空间中音符的分布提出了显著挑战。为解决此问题,我们引入 Music-Diff 架构,拟合音符及其伴随语义信息的联合分布,以条件方式生成符号音乐。我们首先通过使用基于事件的记谱符号和结构相似性指数来增强分块模块,以提取语义信息,从而防止边界模糊。作为多变量扰动的前提,我们引入联合预训练方法,以构建音符与音乐语义之间的进程,同时避免直接建模稀疏音符。最后,我们通过多分支去噪器来恢复被扰动的音符,该去噪器通过帕累托优化拟合多个噪声目标。我们的实验表明,与语言模型相比,同时在音符和语义水平上进行扰动的联合概率扩散模型能够提供更大的样本多样性和组成正则性。案例研究通过分析在自相似指标中所表达的层次结构,突出了我们模型在节奏方面的优势,优于基于语言和 DDPM 的模型。

关键词

引用

@article{arxiv.2408.01950,
  title  = {Why Perturbing Symbolic Music is Necessary: Fitting the Distribution of Never-used Notes through a Joint Probabilistic Diffusion Model},
  author = {Shipei Liu and Xiaoya Fan and Guowei Wu},
  journal= {arXiv preprint arXiv:2408.01950},
  year   = {2024}
}