中文

面向可控符号音乐生成的具有可学习小波的Mamba扩散模型

声音 2025-05-07 v1 人工智能 音频与语音处理

摘要

近期扩散模型在图像合成领域的流行,重新引起了人们对其在其他领域生成任务中潜力的关注。然而,它们在符号音乐生成中的应用在很大程度上仍未被探索,因为符号音乐通常表示为离散事件序列,而标准扩散模型并不太适合离散数据。我们将符号音乐表示为类似图像的钢琴卷帘谱,从而便于使用扩散模型进行符号音乐生成。此外,本研究引入了一种新颖的扩散模型,该模型结合了我们提出的Transformer-Mamba模块和可学习小波变换。利用无分类器引导来生成具有目标和弦的符号音乐。我们的评估表明,我们的方法在音乐质量和可控性方面取得了令人信服的结果,在钢琴卷帘生成方面优于强大的基线模型。我们的代码可在https://github.com/jinchengzhanggg/proffusion获取。

关键词

引用

@article{arxiv.2505.03314,
  title  = {Mamba-Diffusion Model with Learnable Wavelet for Controllable Symbolic Music Generation},
  author = {Jincheng Zhang and György Fazekas and Charalampos Saitis},
  journal= {arXiv preprint arXiv:2505.03314},
  year   = {2025}
}