LLM 管道中的隐藏测量误差扭曲了标注、评估与基准测试
计算与语言
2026-05-14 v6
摘要
LLM 评估决定了哪些模型被部署、采纳哪些安全标准、发表哪些研究结论,以及如何预测 AI 对劳动力市场的影响。然而,标准置信区间忽略了来自评判模型选择、模型温度和提示词措辞的变动性,导致覆盖不足,这在数据量增大时会加剧。被忽略的方差足以足以逆转结论;未对其进行平均的管道会暴露“基准对手”攻击的薄弱点。本文分解了 LLM 管道不确定性的来源,区分了随数据增多而缩小的方差与对研究者设计选择的敏感性,并使用设计-研究投影来降低总体评估误差 (TEE)。在所示的各种案例中,朴素的标准误比 TEE 校正后的标准误小 40%-60%。使用 Chatbot Arena 数据,我们展示朴素的 95% 置信区间随 n 的增大而下降,而 TEE 校正后的置信区间保持在 95%,且 TEE 指导的管道将基准游戏表面从 56 降至 32 Elo (K=27),低于人类基准线。我们进一步表明,小规模试点可恢复诚实的置信区间并投射哪些设计变更最能提高精度。基于这些投影行动,可在相同成本下将 MMLU 估计误差减半,并使 Chatbot Arena 上每次匹配的人类投票一致性提高 7.9 个百分点。
引用
@article{arxiv.2604.11581,
title = {Hidden Measurement Error in LLM Pipelines Distorts Annotation, Evaluation, and Benchmarking},
author = {Solomon Messing},
journal= {arXiv preprint arXiv:2604.11581},
year = {2026}
}