基于 MIDI 的歌声伴奏生成:组合化歌曲管线
声音
2026-05-06 v2 音频与语音处理
摘要
虽然端到端的 lyrics-to-song 模型对 casual 用户方便,但专业歌手需要能够让他们保留核心旋律的 score-to-song 系统。然而,现有的 score-to-song 方法仅限于短形式片段,无法在包含 intro 和桥接等无声部分的长形式生成中保持连贯性。为解决这一瓶颈,我们提出 MIDI 信息驱动的歌声伴奏生成(MIDI-SAG)。不同于传统的 audio-only 模型,MIDI-SAG 利用从 vocal MIDI 中派生的符号 timing 和和弦信息,提供稳定的音乐路线图。通过包含结构规划,该框架定义了时间边界和语义标签,促进 vocal 与 non-vocal 部分的一致生成。我们通过利用专门的预训练模块,实现在单块 GPU 上的数据高效训练,展示了该组合管线的可行性。我们的实验表明,该方法适用于专业 score-to-song 和通用 lyrics-to-song 任务。虽然仍是早期探索,MIDI-SAG 指明了结构化、长形式音乐合成的有前景的方向。音频演示已提供,代码将在 https://composerflow.github.io/web_revealed/ 开源。
关键词
引用
@article{arxiv.2602.22029,
title = {MIDI-Informed Singing Accompaniment Generation in a Compositional Song Pipeline},
author = {Fang-Duo Tsai and Yi-An Lai and Fei-Yueh Chen and Hsueh-Wei Fu and Wei-Jaw Lee and Hao-Chung Cheng and Yi-Hsuan Yang},
journal= {arXiv preprint arXiv:2602.22029},
year = {2026}
}