基准幻觉:大语言模型间的 disagreement 及其科学影响
计算与语言
2026-02-13 v1
摘要
基准测试是衡量和信任大语言模型(LLM)进展的基石。然而,我们的分析揭示了在基准准确率看似收敛时,潜在的认识分歧。我们使用两个主要推理基准——MMLU-Pro 和 GPQA,展示出 achieving comparable accuracy 的 LLM 在 16-66% 的题目上存在 disagreement,顶尖 frontier 模型之间在 16-38% 的题目上也存在 disagreement。这些差异暗示了不同 LLM 的 distinct error profile。当此类模型用于科学数据注释和推断时,其隐藏的 disagreement 会被传导到研究结果中:在教育和政治科学等已发表研究的重新分析中,更换注释模型可使处理效应估计改变超过 80%,甚至有时会反转其符号。这些发现共同说明了一种基准幻觉,即相等的准确率可能掩盖 disagreement,模型选择成为一个隐藏且具有决定性影响的科学可重复性变量。
引用
@article{arxiv.2602.11898,
title = {Benchmark Illusion: Disagreement among LLMs and Its Scientific Consequences},
author = {Eddie Yang and Dashun Wang},
journal= {arXiv preprint arXiv:2602.11898},
year = {2026}
}