中文

MusicEval:用于自动文本到音乐评估的生成式音乐数据集

声音 2025-03-25 v2 音频与语音处理

摘要

从文本描述生成音乐的技术近期取得了快速进展。然而,评估文本到音乐(TTM)系统仍是一个重大挑战,主要因现有客观与主观评估方法难以在性能与成本之间取得平衡。本文提出一种与人类感知一致的 TTM 模型自动评估任务。为解决 TTM 评估中专业音乐评估要求及文本与音乐之间复杂关系带来的挑战,我们收集了 MusicEval——首个生成式音乐评估数据集。该数据集包含 2,748 个由 31 个先进且广泛使用的模型生成的音乐片段,对应 384 个文本提示,并来自 14 位音乐专家的 13,740 条评分。此外,我们构建了一个基于该数据集的 CLAP 评估模型,实验结果验证了所提任务的可行性,为未来 TTM 评估发展提供了重要参考。数据集已公开于 https://www.aishelltech.com/AISHELL_7A。

关键词

引用

@article{arxiv.2501.10811,
  title  = {MusicEval: A Generative Music Dataset with Expert Ratings for Automatic Text-to-Music Evaluation},
  author = {Cheng Liu and Hui Wang and Jinghua Zhao and Shiwan Zhao and Hui Bu and Xin Xu and Jiaming Zhou and Haoqin Sun and Yong Qin},
  journal= {arXiv preprint arXiv:2501.10811},
  year   = {2025}
}

备注

Accepted by ICASSP 2025