中文

面向歌词到旋律生成的语言模型对齐:基于规则的音乐约束

声音 2026-04-21 v1 计算与语言 音频与语音处理

摘要

大型语言模型(LLM)在歌词到旋律生成方面显示出前景,但使用监督微调(SFT)训练的模型常常会产生不符合音乐常规的旋律,存在节奏差异和不适合的声部范围等问题, 我们称之为“约束违规”。为此,我们提出了一种 novel 对齐框架, 在无需人工标注的情况下灌注音乐知识。我们定义基于规则的音乐约束, 从 SFT 模型的输出中自动生成偏好数据集。随后通过分阶段对齐 process 实现:首先使用直接偏好优化(DPO)对成对偏好数据进行训练,随后使用卡恩-图尔塔克优化(KTO)对非配对负样本进行训练。实验结果表明,我们对齐后的模型显著减少规则违规, 在客观和主观评估中均优于强大基线, 生成的旋律在音乐性和连贯性方面得到显著提升。 一个带有音频比较的交互式演示可在 https://arain233.github.io/AligningMelody-demo 查看。

关键词

引用

@article{arxiv.2604.18489,
  title  = {Aligning Language Models for Lyric-to-Melody Generation with Rule-Based Musical Constraints},
  author = {Hao Meng and Siyuan Zheng and Shuran Zhou and Qiangqiang Wang and Yang Song},
  journal= {arXiv preprint arXiv:2604.18489},
  year   = {2026}
}

备注

Accepted by IEEE ICASSP 2026