中文

Easy2Hard-Bench:为评估LLM性能与泛化能力提供标准化难度标签

机器学习 2025-06-10 v2 人工智能 计算与语言

摘要

虽然语言模型(LLM)在从易到难的任务上进行泛化是评估其性能的关键因素,但目前尚缺乏覆盖广泛复杂度、为每个问题标注细粒度难度的 datasets。为此,本文提出Easy2Hard-Bench,一个涵盖数学问题、编程挑战、象棋谜题等多种领域的6个基准数据集的统一格式集合。每个问题均标注了数值难度分数。为系统估计问题难度,我们收集了来自真实世界中人类或LLM在知名排行榜上对各问题尝试的丰富绩效数据。基于这些数据,我们应用项目反应理论(IRT)和Glicko-2模型等既定难度排序系统,对问题进行统一的难度评分。此外,Easy2Hard-Bench与之前数据集的区别在于更高比例的具挑战性问题。通过对6个最先进LLM的大规模实验,我们全面分析了其在不同难度水平上的表现,旨在激励未来在LLM泛化方面的研究。数据集已发布于https://huggingface.co/datasets/furonghuang-lab/Easy2Hard-Bench。

关键词

引用

@article{arxiv.2409.18433,
  title  = {Easy2Hard-Bench: Standardized Difficulty Labels for Profiling LLM Performance and Generalization},
  author = {Mucong Ding and Chenghao Deng and Jocelyn Choo and Zichu Wu and Aakriti Agrawal and Avi Schwarzschild and Tianyi Zhou and Tom Goldstein and John Langford and Anima Anandkumar and Furong Huang},
  journal= {arXiv preprint arXiv:2409.18433},
  year   = {2025}
}

备注

NeurIPS 2024 Datasets and Benchmarks Track