ImprovNet——基于迭代损坏优化的可控音乐即兴生成
声音
2025-05-19 v4 人工智能
音频与语音处理
摘要
尽管深度学习在跨领域的风格迁移方面取得了显著进展,但为完整的符号表示音乐作品生成可控的表演级音乐风格迁移仍然是一个具有挑战性的研究领域。这在很大程度上归因于数据集的局限性,特别是对于爵士等流派,以及缺乏能够处理多种音乐生成任务的统一模型。本文提出了ImprovNet,一种基于Transformer的架构,通过自监督的损坏-优化训练策略生成富有表现力且可控的音乐即兴创作。即兴风格迁移旨在针对目标流派,对原作的一个或多个音乐元素——旋律、和声或节奏——进行有意义的修改。ImprovNet在单一模型中统一了多种能力:它可以执行跨流派和流派内的即兴创作,以特定流派的风格为旋律配和声,并执行短提示续写和填充任务。该模型的迭代生成框架允许用户控制风格迁移的程度以及与原作的结构相似性。客观和主观评估表明,ImprovNet在生成音乐连贯的即兴创作的同时,保持了与原作的结构关系。该模型在短续写和填充任务中优于Anticipatory Music Transformer,并成功实现了可识别的流派转换,79%的参与者正确识别了古典作品的爵士风格即兴创作。我们的代码和演示页面可在 https://github.com/keshavbhandari/improvnet 找到。
引用
@article{arxiv.2502.04522,
title = {ImprovNet -- Generating Controllable Musical Improvisations with Iterative Corruption Refinement},
author = {Keshav Bhandari and Sungkyun Chang and Tongyu Lu and Fareza R. Enus and Louis B. Bradshaw and Dorien Herremans and Simon Colton},
journal= {arXiv preprint arXiv:2502.04522},
year = {2025}
}
备注
10 pages, 6 figures, IJCNN 2025 conference