硅基官僚与AI应试教育:LLM基准中的污染敏感性与分数置信度
人工智能
2026-03-31 v2 计算与语言
摘要
公共基准测试日益主导着大语言模型(LLM)的排名、选择和部署。我们将这种以基准为中心的制度框架称为“硅基官僚”与“AI应试教育”,并认为它建立在一个脆弱的假设之上:基准分数直接反映了真实的泛化能力。然而,在实践中,这些分数可能将应试能力与原则性能力混为一谈,尤其是在现代训练流程中难以排除污染和语义泄漏的情况下。因此,我们提出了一个用于分析LLM基准测试中污染敏感性和分数置信度的审计框架。通过使用路由器-工作者设置,我们将一个干净的控制条件与噪声条件进行比较,在噪声条件下,基准问题在被传递到下游之前被系统地删除、重写和扰动。对于一个真正干净的基准测试,噪声条件下的表现不应持续优于干净控制基线。然而,在多个模型中,我们发现在噪声条件下普遍存在但异质性的高于基线的增益,这表明与基准相关的线索可能被重新组合,并能重新激活与污染相关的记忆。这些结果表明,相似的基准分数可能承载着显著不同的置信度。我们主张,不应完全拒绝基准测试,而应通过明确的污染敏感性和分数置信度审计来补充基于基准的评估。
引用
@article{arxiv.2603.21636,
title = {Silicon Bureaucracy and AI Test-Oriented Education: Contamination Sensitivity and Score Confidence in LLM Benchmarks},
author = {Yiliang Song and Hongjun An and Jiangan Chen and Xuanchen Yan and Huan Song and Jiawei Shao and Xuelong Li},
journal= {arXiv preprint arXiv:2603.21636},
year = {2026}
}
备注
Remove the NeurIPS 2026 template