中文

PerceiverS:一种用于长时程富有表现力的符号音乐生成的多尺度感知器,具有有效分割能力

人工智能 2025-09-23 v3 多媒体 声音 音频与语音处理

摘要

近年来,基于人工智能的音乐生成取得了显著进展。然而,生成既具有长结构又富有表现力的符号音乐仍然是一个重大挑战。在本文中,我们提出了PerceiverS(分割与尺度),这是一种新颖的架构,旨在通过利用有效分割和多尺度注意力机制来解决这个问题。我们的方法通过同时学习长期结构依赖关系和短期表现细节来增强符号音乐生成。通过在多尺度设置中结合交叉注意力和自注意力,PerceiverS在捕捉长程音乐结构的同时保留了演奏的细微差别。所提出的模型已在Maestro数据集上进行了评估,并展示了在生成连贯且多样化的音乐方面的改进,其特点是结构一致性和表现力变化。项目演示和生成的音乐样本可通过以下链接访问:https://perceivers.github.io。

关键词

引用

@article{arxiv.2411.08307,
  title  = {PerceiverS: A Multi-Scale Perceiver with Effective Segmentation for Long-Term Expressive Symbolic Music Generation},
  author = {Yungang Yi and Weihua Li and Matthew Kuo and Quan Bai},
  journal= {arXiv preprint arXiv:2411.08307},
  year   = {2025}
}