基于 MIDI-RWKV 的可适应符号音乐填充
声音
2026-01-27 v2 机器学习
多媒体
音频与语音处理
摘要
现有的自动音乐生成工作大多 focus于 end-to-end 系统,既生成整个作品,也生成作品的延续部分,这些系统对作曲家的迭代难以实现。计算机辅助作曲领域,即将生成模型集成到现有创作工作流程中的方法,相对研究不足。在本研究中,我们解决了模型风格适应和多轨道、长上下文和可控符号音乐填充等任务,以增强计算机辅助作曲的过程。我们提出了 MIDI-RWKV,这是一个基于 RWKV-7 线性架构的小型基础模型,旨在在边缘设备上实现高效且连贯的音乐协作。我们还展示了 MIDI-RWKV 能够有效地通过微调其初始状态来实现在极低样本 regime 下的风格适应。我们对 MIDI-RWKV 及其状态调谐在多个定量和定性指标上进行了评估,并在 https://github.com/christianazinn/MIDI-RWKV 上发布了模型权重和代码。
引用
@article{arxiv.2506.13001,
title = {Adaptable Symbolic Music Infilling with MIDI-RWKV},
author = {Christian Zhou-Zheng and Philippe Pasquier},
journal= {arXiv preprint arXiv:2506.13001},
year = {2026}
}
备注
31 pages, 15 figures, 17 tables