中文

基于人类偏好的音乐生成模型基准测试

机器学习 2025-06-25 v1 声音

摘要

近期进步使生成音乐更接近人类创作的作品,但评估这些模型仍然具有挑战性。虽然人类偏好是评估质量的黄金标准,但将主观判断转化为客观指标(尤其是针对文本-音频对齐和音乐质量)仍然困难。本文生成 6000 首歌曲,使用 12 个最先进的模型,并对 15000 组成对音频进行 2500 名人类参与者的调查,以评估人类偏好与广泛使用的指标之间的相关性。据我们了解,本工作是首个依据人类偏好对当前最先进的音乐生成模型和指标进行排名的研究。为进一步推动主观指标评估领域,我们提供了对生成音乐及人类评估数据集的开放访问。

关键词

引用

@article{arxiv.2506.19085,
  title  = {Benchmarking Music Generation Models and Metrics via Human Preference Studies},
  author = {Florian Grötschla and Ahmet Solak and Luca A. Lanzendörfer and Roger Wattenhofer},
  journal= {arXiv preprint arXiv:2506.19085},
  year   = {2025}
}

备注

Accepted at ICASSP 2025