STAGE:通过前缀条件化的干茎伴奏生成
声音
2025-04-10 v2 音频与语音处理
摘要
近期生成模型的进展使得能够创建高质量、连贯的音乐,部分系统甚至能提供制作级别的输出。然而,大多数现有模型仅关注从头生成音乐,限制了其在希望将其集成到人类、迭代作曲工作流程中的音乐家的实用性。在本文中,我们介绍了 STAGE(STemmed Accompaniment GEneration model),该模型基于最先进的 MusicGen 进行微调,以生成以给定混合音为条件的单轨乐器伴奏。灵感来自语言模型的指令调优方法,我们扩展了 transformer 的嵌入矩阵,添加上下文标记,使模型能够通过前缀条件化关注音乐背景。与基线方法相比,STAGE 生成的伴奏在与输入混合音的连贯性、音频质量以及与文本提示的对齐度方面表现更佳。此外,通过以节拍器-like 轨道为条件,Our框架自然支持节拍受限生成,实现了与目标节奏结构的最先进对齐——无需任何额外的节拍特定模块。结果,STAGE 提供了一个实用、灵活的工具,可被音乐家轻松采纳于实际工作流程中。
引用
@article{arxiv.2504.05690,
title = {STAGE: Stemmed Accompaniment Generation through Prefix-Based Conditioning},
author = {Giorgio Strano and Chiara Ballanti and Donato Crisostomi and Michele Mancusi and Luca Cosmo and Emanuele Rodolà},
journal= {arXiv preprint arXiv:2504.05690},
year = {2025}
}