统一化符号音乐编排:基于轨道感知的重构与结构化分词
声音
2025-11-06 v5 计算与语言
音频与语音处理
摘要
我们提出了一个用于自动多轨音乐编排的统一框架,使单个预训练的符号音乐模型能够处理包括再解释、简化和增量生成在内的多样化编排场景。其核心是作用于 token 级别上解耦的内容和风格的分段级重构目标,使其在推理时能够灵活地进行任何到任何的乐器转换。为支持轨道级建模,我们引入了 REMI-z,这是一种用于多轨符号音乐的结构化分词方案,旨在提高编排任务和无条件生成的建模效率和效果。我们的方法在不同编排场景中的代表性任务——乐队编排、钢琴简化和鼓组编排——上超越了任务特定的 SOTA 模型,在客观指标和感知评估方面均表现出色。综上所述,我们的框架表现出强大的通用性,表明其在符号音乐到音乐转换中具有更广泛的适用性。
引用
@article{arxiv.2408.15176,
title = {Unifying Symbolic Music Arrangement: Track-Aware Reconstruction and Structured Tokenization},
author = {Longshen Ou and Jingwei Zhao and Ziyu Wang and Gus Xia and Qihao Liang and Torin Hopkins Ye Wang},
journal= {arXiv preprint arXiv:2408.15176},
year = {2025}
}
备注
NeurIPS 2025 camera ready version