YourBench:面向所有人的易用自定义评估集
计算与语言
2025-04-03 v1 人工智能
摘要
有效评估大型语言模型 (LLM) 长期是关键瓶颈,传统静态基准受限于饱和与污染,而人类评估成本高昂且缓慢,阻碍了及时或领域特定的评估,这对于实际应用至关重要。我们提出 YourBench,一个新型开源框架,旨在通过启用动态、自动化地从用户提供的文档中生成可靠、及时且领域定制的基准,来缓解这些限制,无需人工标注即可实现。我们通过最小源文本复制 7 个多样化的 MMLU 子集来展示其效用,总计推理成本不足 15 美元,同时完美保留原始基准中观察到的模型性能排名 (Spearman Rho = 1)。为确保 YourBench 生成的数据以提供的输入为依托,而非依赖模型中后验参数知识,我们还引入了 Tempora-0325,一个包含超过 7000 个多样化文档的新型数据集,这些文档仅在 2025 年 3 月之后发布。我们的全面分析涵盖 26 个来自 7 大家族、规模从 30 亿至 6710 亿参数的 SoTA 模型,以通过严格的算法检查 (如引用 grounding) 和人类评估来验证生成评估的质量。我们发布 YourBench 库、Tempora-0325 数据集、15 万+ question-answer 对,以及所有评估与推理痕迹,以促进可重复研究,使社区能够按需生成定制化基准,培育更具相关性与可信度的 LLM 评估。
引用
@article{arxiv.2504.01833,
title = {YourBench: Easy Custom Evaluation Sets for Everyone},
author = {Sumuk Shashidhar and Clémentine Fourrier and Alina Lozovskia and Thomas Wolf and Gokhan Tur and Dilek Hakkani-Tür},
journal= {arXiv preprint arXiv:2504.01833},
year = {2025}
}