中文

Text2midi-InferAlign:基于推理时对齐的符号音乐生成改进

声音 2025-05-20 v1 人工智能 多媒体 音频与语音处理

摘要

我们提出Text2midi-InferAlign,一种在推理阶段改进符号音乐生成的新技术。我们的方法利用文本到音频对齐和音乐结构对齐奖励,在推理过程中鼓励生成的音乐与输入标题保持一致。具体而言,我们引入两个目标得分:一个衡量生成音乐与原始文本标题之间节奏对齐程度的文本-音频一致性得分,以及一个惩罚生成音乐中包含与调性不一致音符的和声一致性得分。通过在生成过程中优化这些基于对齐的目标,我们的模型产生的符号音乐更贴合输入标题,从而提高生成作品的整体质量和连贯性。我们的做法可以无需进一步训练或微调地扩展任何现有的自回归模型。我们在Text2midi——一个现有的文本到MIDI生成模型之上进行评估,展示了在客观和主观评估指标方面的显著改进。

关键词

引用

@article{arxiv.2505.12669,
  title  = {Text2midi-InferAlign: Improving Symbolic Music Generation with Inference-Time Alignment},
  author = {Abhinaba Roy and Geeta Puri and Dorien Herremans},
  journal= {arXiv preprint arXiv:2505.12669},
  year   = {2025}
}

备注

7 pages, 1 figure, 5 tables