中文

基于 MIDI 的歌声伴奏生成:组合化歌曲管线

声音 2026-05-06 v2 音频与语音处理

摘要

虽然端到端的 lyrics-to-song 模型对 casual 用户方便,但专业歌手需要能够让他们保留核心旋律的 score-to-song 系统。然而,现有的 score-to-song 方法仅限于短形式片段,无法在包含 intro 和桥接等无声部分的长形式生成中保持连贯性。为解决这一瓶颈,我们提出 MIDI 信息驱动的歌声伴奏生成(MIDI-SAG)。不同于传统的 audio-only 模型,MIDI-SAG 利用从 vocal MIDI 中派生的符号 timing 和和弦信息,提供稳定的音乐路线图。通过包含结构规划,该框架定义了时间边界和语义标签,促进 vocal 与 non-vocal 部分的一致生成。我们通过利用专门的预训练模块,实现在单块 GPU 上的数据高效训练,展示了该组合管线的可行性。我们的实验表明,该方法适用于专业 score-to-song 和通用 lyrics-to-song 任务。虽然仍是早期探索,MIDI-SAG 指明了结构化、长形式音乐合成的有前景的方向。音频演示已提供,代码将在 https://composerflow.github.io/web_revealed/ 开源。

关键词

引用

@article{arxiv.2602.22029,
  title  = {MIDI-Informed Singing Accompaniment Generation in a Compositional Song Pipeline},
  author = {Fang-Duo Tsai and Yi-An Lai and Fei-Yueh Chen and Hsueh-Wei Fu and Wei-Jaw Lee and Hao-Chung Cheng and Yi-Hsuan Yang},
  journal= {arXiv preprint arXiv:2602.22029},
  year   = {2026}
}