中文

HLE-Verified: 人类最后考试的系统性验证与结构化修订

计算与语言 2026-03-02 v3

摘要

人类的最后考试(HLE)已成为评估前沿大型语言模型在具有挑战性、多领域问题上的表现的广泛使用基准。然而,社区领导的分析提出了HLE包含非平凡数量的噪声项目的担忧,这些项目可能偏向评估结果并扭曲跨模型比较。为解决这一挑战,我们引入HLE-Verified,这是一个经验证、修订的HLE版本,具有透明的验证协议和细粒度错误分类。我们的构建遵循两个阶段的验证与修复工作流程, resulting in a certified benchmark。在阶段I中,每个项目通过领域专家审查和基于模型的交叉检查进行二元验证问题和最终答案,得到668个已验证的项目。在阶段II中,对有缺陷但可修复的项目在严格保持原始评估意图的约束下进行修订,通过双独立专家修复、模型辅助审计和最终裁决,得到1,143个已修订认证的项目。剩余的689个项目作为带有明确不确定来源和专业专家标签的文档化不确定集合发布,以供未来细化。我们在HLE和HLE-Verified上评估了八个最先进的语言模型,观察到HLE-Verified上平均绝对准确率提升为7--10个百分点。该改进在原始问题语句和/或参考答案存在错误的项目上尤为显著,提升为30--40个百分点。我们的分析进一步揭示了模型置信度与问题语句或参考答案错误的存在之间存在强关联,支持我们修订的有效性。总体而言,HLE-Verified通过减少注释噪声并更可靠地衡量模型能力,改进了HLE风格的评估。数据可在:https://huggingface.co/datasets/skylenage/HLE-Verified 获取。

关键词

引用

@article{arxiv.2602.13964,
  title  = {HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam},
  author = {Weiqi Zhai and Zhihai Wang and Jinghang Wang and Boyu Yang and Xiaogang Li and Xander Xu and Bohan Wang and Peng Wang and Xingzhe Wu and Anfeng Li and Qiyuan Feng and Yuhao Zhou and Shoulin Han and Wenjie Luo and Yiyuan Li and Yaxuan Wang and Ruixian Luo and Guojie Lin and Peiyao Xiao and Chengliang Xu and Ben Wang and Zeyu Wang and Zichao Chen and Jianan Ye and Yijie Hu and Jialong Chen and Zongwen Shen and Yuliang Xu and An Yang and Bowen Yu and Dayiheng Liu and Junyang Lin and Hu Wei and Que Shen and Bing Zhao},
  journal= {arXiv preprint arXiv:2602.13964},
  year   = {2026}
}

备注

14 pages, 10 figures