中文

基于多奖励Direct Preference优化的流匹配文本到音乐生成:MR-FlowDPO

声音 2025-12-16 v2

摘要

音乐生成模型缺乏与人类偏好直接对齐是其关键挑战之一,因为音乐评估本质上是主观的且在个体之间差异很大。我们引入MR-FlowDPO,一种新方法,通过针对多种音乐奖励的Direct Preference优化(DPO)来增强基于流匹配的音乐生成模型——现代音乐生成模型的主要类别之一。这些奖励被设计用于衡量音乐在三个关键维度上的质量:文本对齐性、音频生产质量和语义一致性,利用可扩展的现成模型进行每项奖励的预测。我们以两种方式运用这些奖励:(i)构建DPO的偏好数据;(ii)将奖励集成到文本提示中。为解决音乐性评估的模糊性,我们提出了一种新颖的评分机制,利用语义自监督表示,显著提高了生成音乐的节奏稳定性。我们进行了广泛的评估,包括多种音乐专用的客观指标以及人类研究。结果表明,MR-FlowDPO显著提升了整体音乐生成质量,在音频质量、文本对齐和音乐性方面均 consistently 优于高度具竞争力的基准方法。我们的代码已公开于https://github.com/lonzi/mrflow_dpo。样本可在我们的演示页面https://lonzi.github.io/mr_flowdpo_demopage/获取。

关键词

引用

@article{arxiv.2512.10264,
  title  = {MR-FlowDPO: Multi-Reward Direct Preference Optimization for Flow-Matching Text-to-Music Generation},
  author = {Alon Ziv and Sanyuan Chen and Andros Tjandra and Yossi Adi and Wei-Ning Hsu and Bowen Shi},
  journal= {arXiv preprint arXiv:2512.10264},
  year   = {2025}
}