中文

CMI-RewardBench:基于组合多模态指令的音乐奖励模型评估

声音 2026-03-05 v2 人工智能 机器学习 多媒体 音频与语音处理

摘要

虽然音乐生成模型已演化为能够处理混合文本、歌词和参考音频的复杂多模态输入,但评估机制仍滞后于发展。本文通过建立一个全面的生态系统,弥合这一关键差距,专注于组合多模态指令(CMI)下的音乐奖励建模,其中生成的音乐可能基于文本描述、歌词和音频提示进行条件化。我们首先引入 CMI-Pref-Pseudo,一个包含 11 万伪标记样本的大规模偏好数据集,以及 CMI-Pref,一个高质量的人工标注语料库,专为细粒度对齐任务而设计。为统一评估格局,我们提出 CMI-RewardBench,一个统一的基准,评估音乐奖励模型在 musicality、text-music alignment 和 compositional instruction alignment 三方面的表现。借助这些资源,我们开发了 CMI 奖励模型(CMI-RMs),一系列参数高效的奖励模型,能够处理异构输入。我们在 CMI-Pref 以及先前数据集上评估了其与人类判断分数的相关性。进一步的实验表明,CMI-RM 不仅与人类判断分数高度相关,而且通过 top-k 筛选实现了有效的推理时放大。所需的训练数据、基准和奖励模型已全部公开。

关键词

引用

@article{arxiv.2603.00610,
  title  = {CMI-RewardBench: Evaluating Music Reward Models with Compositional Multimodal Instruction},
  author = {Yinghao Ma and Haiwen Xia and Hewei Gao and Weixiong Chen and Yuxin Ye and Yuchen Yang and Sungkyun Chang and Mingshuo Ding and Yizhi Li and Ruibin Yuan and Simon Dixon and Emmanouil Benetos},
  journal= {arXiv preprint arXiv:2603.00610},
  year   = {2026}
}