超越均值:用于大语言模型评估的模型内可靠变化检测
计算与语言
2026-05-01 v1 人工智能
摘要
我们将临床心理学中的可靠变化指数(RCI;Jacobson和Truax,1991)应用于2000个MMLU-Pro项目上的项目级大语言模型版本比较(K=10个样本,T=0.7)。测试了两个同家族配对:Llama 3到3.1(+1.6分)和Qwen 2.5到3(+2.8分)。在整个基准测试中,大多数项目未显示可靠变化(79%和72%)。然而,超过一半的项目处于地板/天花板效应。在可分析的项目中,变化是双向的且效应量大:Llama有34%改善,28%恶化;Qwen有47%改善,39%恶化(中位数|delta p| = 0.50和0.90)。变化率按难度不对称:低准确率项目改善,高准确率项目恶化。领域级分解揭示了家族特定的反转:Llama在物理上下降,而Qwen在法律上下降。贪婪单次评估遗漏了42%的可靠变化项目,并错误标记了25%的未变化项目。总体准确率增益是相反项目级变动的净残差。我们建议在报告总体准确率的同时报告变化率。
引用
@article{arxiv.2604.27405,
title = {Beyond the Mean: Within-Model Reliable Change Detection for LLM Evaluation},
author = {Jon-Paul Cacioli},
journal= {arXiv preprint arXiv:2604.27405},
year = {2026}
}
备注
7 pages, 4 figures, 2 tables. Pre-registered study. Code and data available