中文

基准健康指数:用于评估大语言模型基准测试基准的系统框架

人工智能 2026-02-13 v1

摘要

大语言模型 (LLM) 正在迅速发展,但用于衡量这一进展的基准测试正变得越来越不可靠。得分虚高和选择性报告已侵蚀了标准基准测试的权威性,使社区难以确定哪些评估结果值得信赖。我们提出基准健康指数 (Benchmark Health Index, BHI),这是一套纯数据驱动的框架,用于沿三个正交且互补的维度审计评估集:(1) 能力区分度,衡量基准测试在噪声之外如何精准分隔模型性能;(2) 反饱和度,估计在瓶颈效应消除分辨率前的剩余潜力,从而预测基准测试的预期寿命;(3) 影响力,通过采用范围和实践塑造力量对学术和产业生态系统的影响进行量化。通过提炼 2025 年 91 个代表性模型技术报告中的 106 个验证基准测试,我们系统性地描绘了评估格局。BHI 是首个在宏观层面量化基准测试健康状况的框架,为基准测试选择提供原则依据,使下代评估协议能够实现动态生命周期管理。

关键词

引用

@article{arxiv.2602.11674,
  title  = {Benchmark Health Index: A Systematic Framework for Benchmarking the Benchmarks of LLMs},
  author = {Longyuan Zhu and Hairan Hua and Linlin Miao and Bing Zhao},
  journal= {arXiv preprint arXiv:2602.11674},
  year   = {2026}
}

备注

42 pages, 8 figures, 7 tables. Code and website available at https://github.com/SKYLENAGE-AI/benchmark-health-index