中文

音乐大师还是音乐困难户:面向大型语言模型的大规模音乐评估基准

声音 2024-06-25 v1 人工智能 音频与语音处理

摘要

基准测试在评估大型语言模型(LLMs)的进展中起着关键作用。尽管已有许多基准被提出用于评估LLMs的能力,但明显缺乏一个专门用于评估其音乐能力的基准。为填补这一空白,我们提出了ZIQI-Eval,一个专门设计用于评估LLMs音乐相关能力的全面且大规模的音乐基准。ZIQI-Eval包含广泛的问题,涵盖10个主要类别和56个子类别,共计超过14,000条精心整理的数据条目。通过利用ZIQI-Eval,我们对16个LLMs进行了全面评估,以评估和分析LLMs在音乐领域的表现。结果表明,所有LLMs在ZIQI-Eval基准上表现不佳,表明其音乐能力有显著的提升空间。通过ZIQI-Eval,我们旨在提供一个标准化且稳健的评估框架,以促进对LLMs音乐相关能力的全面评估。该数据集可在GitHub和HuggingFace上获取。

关键词

引用

@article{arxiv.2406.15885,
  title  = {The Music Maestro or The Musically Challenged, A Massive Music Evaluation Benchmark for Large Language Models},
  author = {Jiajia Li and Lu Yang and Mingni Tang and Cong Chen and Zuchao Li and Ping Wang and Hai Zhao},
  journal= {arXiv preprint arXiv:2406.15885},
  year   = {2024}
}

备注

Accepted to ACL-Findings 2024