中文

关注旋律:基于课程遮蔽的单编码器旋律和声化

声音 2026-01-23 v1 人工智能

摘要

旋律和声化是为给定旋律生成和声伴奏的任务,仍是计算音乐生成中的核心挑战。最近的单编码器变压器方法将和声化建模为掩码序列建模问题,但现有训练课程受离散扩散启发往往导致旋律和和声之间的(交叉)注意力较弱,进而在特别是跨域情境中 limited exploitation of melodic cues。 In this work, we introduce a training curriculum, FF (full-to-full), which keeps all harmony tokens masked for several training steps before progressively unmasking entire sequences during training to strengthen melody-harmony interactions. 我们系统评估了该方法相对于先前课程的效果,通过多个实验轴进行评估,包括时间量化(四分音符 vs. 十六分音符)、bar-level vs. time-signature conditioning、旋律表示(全范围 vs. 音阶类)以及推理时的遮蔽策略。模型在 HookTheory 数据集上训练,并使用全套指标对模型进行评估,这些指标评估和声 Progression 结构、和声-旋律对齐和节奏连贯性。结果表明,提出的 FF 课程在几乎所有指标上都优于基线,特别是在跨域评估中表现突出,其中对新旋律队列的和声可塑性至关重要。我们进一步发现,四分音符量化、bar token 的交织以及音阶类旋律表示在 FF 设置下优势明显。我们的发现凸显了训练课程在实现有效旋律条件化中的重要性,并表明 full-to-full 遮蔽为单一编码器和声化提供了稳健的策略。

关键词

引用

@article{arxiv.2601.16150,
  title  = {Pay (Cross) Attention to the Melody: Curriculum Masking for Single-Encoder Melodic Harmonization},
  author = {Maximos Kaliakatsos-Papakostas and Dimos Makris and Konstantinos Soiledis and Konstantinos-Theodoros Tsamis and Vassilis Katsouros and Emilios Cambouropoulos},
  journal= {arXiv preprint arXiv:2601.16150},
  year   = {2026}
}