中文

BandCondiNet:基于平行Transformer的条件化流行音乐生成及多视图特征

声音 2025-10-27 v2 人工智能 多媒体 音频与语音处理

摘要

条件化音乐生成在用户便利性和控制性方面具有显著优势,具有巨大的潜力用于AI生成内容研究。然而,为多轨流行歌曲构建条件生成系统面临三个主要挑战:输入条件的保真度不足、结构建模不足以及生成模型中轨道间和谐学习不足。为解决这些问题,我们提出BandCondiNet,这是一个基于平行Transformer的条件模型,用于处理多个音乐序列并生成高质量的多轨样本。具体而言,我们提出跨时间和乐器的多视图特征作为高保真条件。此外,我们提出两个专用模块用于BandCondiNet:结构增强注意力(SEA)以强化音乐结构,跨轨道Transformer(CTT)以增强轨道间和谐。我们在两个不同序列长度的流行音乐数据集上进行了客观和主观评估。客观结果显示,在较短的数据集上,BandCondiNet在9个与保真度和推理速度相关的10项指标中超过其他条件模型(除和弦准确率外),在较长的数据集上,BandCondiNet在所有10项指标中超越所有条件模型。主观评估在四个标准下表明,训练较短数据集的BandCondiNet在丰富性方面表现最佳,而在其他三个标准上与最新方法相当;而在训练较长数据集时,BandCondiNet在所有标准上均显著优于其他方法。为进一步拓展BandCondiNet的应用范围,未来工作应聚焦于开发能够适应更加用户友好输入条件并支持灵活乐器配置的高级条件模型。

关键词

引用

@article{arxiv.2407.10462,
  title  = {BandCondiNet: Parallel Transformers-based Conditional Popular Music Generation with Multi-View Features},
  author = {Jing Luo and Xinyu Yang and Dorien Herremans},
  journal= {arXiv preprint arXiv:2407.10462},
  year   = {2025}
}

备注

To appear in ESWA. Demo page: https://chinglohsiu.github.io/files/bandcondinet.html