音乐大师还是音乐困难户:面向大型语言模型的大规模音乐评估基准
声音
2024-06-25 v1 人工智能
音频与语音处理
摘要
基准测试在评估大型语言模型(LLMs)的进展中起着关键作用。尽管已有许多基准被提出用于评估LLMs的能力,但明显缺乏一个专门用于评估其音乐能力的基准。为填补这一空白,我们提出了ZIQI-Eval,一个专门设计用于评估LLMs音乐相关能力的全面且大规模的音乐基准。ZIQI-Eval包含广泛的问题,涵盖10个主要类别和56个子类别,共计超过14,000条精心整理的数据条目。通过利用ZIQI-Eval,我们对16个LLMs进行了全面评估,以评估和分析LLMs在音乐领域的表现。结果表明,所有LLMs在ZIQI-Eval基准上表现不佳,表明其音乐能力有显著的提升空间。通过ZIQI-Eval,我们旨在提供一个标准化且稳健的评估框架,以促进对LLMs音乐相关能力的全面评估。该数据集可在GitHub和HuggingFace上获取。
引用
@article{arxiv.2406.15885,
title = {The Music Maestro or The Musically Challenged, A Massive Music Evaluation Benchmark for Large Language Models},
author = {Jiajia Li and Lu Yang and Mingni Tang and Cong Chen and Zuchao Li and Ping Wang and Hai Zhao},
journal= {arXiv preprint arXiv:2406.15885},
year = {2024}
}
备注
Accepted to ACL-Findings 2024