基准测试在模型超过评判者智能时会饱和
人工智能
2026-01-28 v1 计算与语言
机器学习
摘要
基准测试是跟踪大型语言模型(Large Language Models, LLMs)开发进展的重要工具,但数据集和评估方法中的不准确问题不断削弱其有效性。我们present了 Omni-MATH-2,这是一个手动修订版的 Omni-MATH 数据集,包含一个干净、精确答案子集()和一个标记的非标准子集()。对每个问题进行审计,以确保 LaTeX 可编译性、可求解性和可验证性,这涉及添加遗漏的图表或信息、标记需要证明、估计或图像的问题,以及删除杂乱信息。这一过程显著减少了数据集引起的噪声,从而提供了更精确的模型性能评估。标记后的数据集还允许我们通过将 GPT-5 mini 与原始 Omni-Judge 进行比较来评估评判者引起的噪声,揭示了评判者在干净子集和标记子集上的重大差异。专家注释显示,Omni-Judge 在评判者不一致性中的错误率高达96.4%,表明它甚至在基准测试饱和之前,无法区分模型之间的能力差异。随着问题变得更具挑战性,我们发现越来越有能力的评判者对于防止评判者错误掩盖模型之间真实差异至关重要。最后,Neither judge 在标记问题子集的当前失效模式方面发表了任何发现,表明数据集质量和评判者可靠性都是开发准确模型性能基准的关键。
引用
@article{arxiv.2601.19532,
title = {Benchmarks Saturate When The Model Gets Smarter Than The Judge},
author = {Marthe Ballon and Andres Algaba and Brecht Verbeken and Vincent Ginis},
journal= {arXiv preprint arXiv:2601.19532},
year = {2026}
}
备注
17 pages, 10 figures, 3 tables