中文

AI基准中的精彩错误与寻找之道

人工智能 2025-11-24 v1 计算与语言 机器学习

摘要

基准测试是推动AI进步的关键因素,无效的基准问题频繁地削弱了其可靠性。手动识别和纠正数千个基准问题既不可行,也是可靠评估的关键瓶颈。本文引入了一个系统性基准修订框架,利用响应模式的统计分析标记潜在无效问题,以便进行专家审阅。我们的 метод基于AI评估中常用的核心假设,即平均得分足以概括模型性能。这一假设意味着测量实验中潜在的单维构念,其项目的各种统计量都有预期范围。当经验估计的统计量值超出该项目的预期范围时,该项目更可能存在问题。在九个广泛使用的基准测试中,我们的方法指导专家审阅以识别具有最高可达84%精度的问题。此外,我们引入了LLM-judge的首次通过审阅问题,进一步减少人力工作量。这些组件共同提供了一个高效且可扩展的系统性基准修订框架。

关键词

引用

@article{arxiv.2511.16842,
  title  = {Fantastic Bugs and Where to Find Them in AI Benchmarks},
  author = {Sang Truong and Yuheng Tu and Michael Hardy and Anka Reuel and Zeyu Tang and Jirayu Burapacheep and Jonathan Perera and Chibuike Uwakwe and Ben Domingue and Nick Haber and Sanmi Koyejo},
  journal= {arXiv preprint arXiv:2511.16842},
  year   = {2025}
}