中文

流体语言模型基准测试

高能物理 - 唯象学 2026-01-08 v2 宇宙学与河外天体物理 高能物理 - 理论

摘要

语言模型(LM)基准测试面临诸多挑战:综合评估成本高昂、基准测试往往未能衡量既定能力,以及因标签错误和基准测试饱和而导致评估质量下降。尽管提出了各种策略来缓解这些问题,但这些策略往往仅在孤立层面处理,忽视了关于整体评估质量的更广泛问题。本文引入流体基准测试(Fluid Benchmarking),一种新的评估方法,跨多个维度推进 LM 基准测试。灵感来源于心理学测量学,流体基准测试的核心洞见在于:基准测试项目的相对价值取决于 LM 的能力水平,表明评估应针对每个 LM 进行适应。方法论上,流体基准测试基于现有 LM 评估结果推估项目响应模型,并利用推断量选择评估项目,类似于教育中的计算机化自适应测试。我们的实验将流体基准测试与常见的随机项目抽样方法以及更为精妙的基线方法进行比较,后者包括基于项目响应理论的替代方法。我们检验四个维度——效率、效度、方差和饱和度——并发现流体基准测试在所有方面均表现优异(例如,在 MMLU 上使用 fifty 倍更少的项目即可实现更高效度和更低方差)。我们的分析表明,流体基准测试的两个组成部分具有独立的影响:项目响应理论用于将性能映射到潜在能力空间,从而提升效度;而动态项目选择则降低方差。总体而言,我们的结果表明,超越静态评估,LM 基准测试可得到显著提升。

关键词

引用

@article{arxiv.2509.11107,
  title  = {Gravitational Waves from $\textit{Type-I}$ Strings in a Neutrino Mass Model},
  author = {Adeela Afzal},
  journal= {arXiv preprint arXiv:2509.11107},
  year   = {2026}
}

备注

8 pages, 4 figures, 1 table: Matches the published version