中文

使用级联扩散模型的符号音乐整曲层次生成

声音 2024-05-17 v1 人工智能 机器学习 音频与语音处理

摘要

最近的深度音乐生成研究非常注重具有结构的长期生成。然而,我们尚未看到高质量、结构良好的整曲生成。在本文中,我们首次尝试在作曲层次结构的实现下对完整音乐作品进行建模。专注于流行歌曲的符号表示,我们定义了一种层次语言,其中每一层都关注特定音乐范围内的语义和上下文依赖性。高层语言揭示整曲形式、乐句和终止式,而低层语言关注音符、和弦及其局部模式。训练了一个级联扩散模型来建模层次语言,其中每一层以其上层为条件。实验和分析表明,我们的模型能够生成具有可识别的全局主歌-副歌结构和终止式的完整乐曲,且音乐质量高于基线。此外,我们展示了所提模型可以灵活控制。通过从可解释的层次语言中采样或调整预训练的外部表示,用户可以控制音乐流,例如乐句和声结构、节奏模式和伴奏织体。

关键词

引用

@article{arxiv.2405.09901,
  title  = {Whole-Song Hierarchical Generation of Symbolic Music Using Cascaded Diffusion Models},
  author = {Ziyu Wang and Lejun Min and Gus Xia},
  journal= {arXiv preprint arXiv:2405.09901},
  year   = {2024}
}

备注

Proceedings of the International Conference on Learning Representations (ICLR 2024)