中文

ABC-Eval:大规模语言模型在符号音乐理解与指令遵循上的基准测试

声音 2025-09-30 v1 人工智能

摘要

随着大规模语言模型的持续发展,基于文本的符号音乐任务的可行性和重要性日益突出。虽然符号音乐在生成任务中被广泛使用,但LLM在理解和推理符号音乐方面的能力仍未被充分探索。为填补这一空白,我们提出了ABC-Eval——首个专注于基于文本的ABC记谱法乐谱的理解与指令遵循能力的开源基准。它包含1086个测试样本,涵盖10个子任务,场景从基础音乐语法理解到复杂序列级推理不等。如此多样的范围对模型处理符号音乐任务的能力提出了重大挑战。我们在ABC-Eval上评估了七个最先进的LLM,结果揭示了现有模型在符号音乐处理能力方面的显著局限。此外,各基线在不同子任务上的一致性表现支持了我们基准的可靠性。

关键词

引用

@article{arxiv.2509.23350,
  title  = {ABC-Eval: Benchmarking Large Language Models on Symbolic Music Understanding and Instruction Following},
  author = {Jiahao Zhao and Yunjia Li and Wei Li and Kazuyoshi Yoshii},
  journal= {arXiv preprint arXiv:2509.23350},
  year   = {2025}
}