BenchScope:您的基准测试提供多少独立信号?
人工智能
2026-04-01 v1
摘要
AI 评估套装常在报告大量分数而未检查这些分数是否携带独立信息。我们引入 Effective Dimensionality(ED),即中心化基准得分光谱的参与比,作为一种快速、受 population 条件限制的上限诊断工具,用于衡量测量广度。在对 22 个基准测试跨 8 个领域和超过 8400 项模型评估的粒度上应用时,ED 揭示了 substantial 的冗余:6 分数的 Open LLM Leaderboard 的行为类似于大约两个有效测量轴(ED = 1.7),BBH 和 MMLU-Pro 几乎可互换(rho = 0.96,稳定于七个子 population),测量广度在当前基准测试之间差异超过 20 倍。我们展示了相对 ED 排名在匹配维度控制下保持稳定,ED 可用于标记冗余套件组件、监控性能条件压缩和指导基准维护。由于二进制谱会高估绝对潜在维度,我们将 ED 解释为一种筛查统计量而非字面因子计数,并补充 null、可靠性和饱和度分析。我们提供 22 个基准测试的参考图谱和一个四步诊断工作流程,基准维护者只需使用得分矩阵和几行代码即可运行。
引用
@article{arxiv.2603.29357,
title = {BenchScope: How Many Independent Signals Does Your Benchmark Provide?},
author = {Tommy Sha and Stella Zhao},
journal= {arXiv preprint arXiv:2603.29357},
year = {2026}
}
备注
Equal contribution; correspondence: [email protected], [email protected];