面向成对 LLM 评估的分辨诊断
计算与语言
2026-05-29 v1 机器学习
摘要
在两个公开的 LLM 排行榜中,许多显示的成对排名在实际成对评估设计下未能满足常规成对检验分辨目标:11 个 Open LLM Leaderboard v1 中的成对比较以及 4 个 MMLU-Pro 前 10 名相邻排名在 (alpha, 1-beta) = (0.05, 0.8) 下未被解决。在真实主题层次聚类下,MMLU-Pro 的未决对数升至 6/9,并在 99.9% 的类别自助抽样中保持在 5-6/9。我们将成对 LLM 评估建模为假设检验问题,反向求解水平为 alpha、功效为 (1-beta) 的检验,并报告每个成对分辨率比 q = N/N* 作为主要诊断。锐利的小效应扩展带有显式二阶常数显示,广泛使用的非成对 Cohen-h 加 (1-rho) 快捷方式在接近比较 regime 中与正确 N* 相差约为二分之一,这一缺口是 5 个通用计算器 (Cohen 1988、G*Power、R pwr) 在用户对其单臂输出后乘以 (1-rho) 时悄然继承的。未决对模式在多重性校正和随时有效顺序测试下仍然存在。
引用
@article{arxiv.2605.30315,
title = {Resolution Diagnostics for Paired LLM Evaluation},
author = {Anany Kotawala},
journal= {arXiv preprint arXiv:2605.30315},
year = {2026}
}
备注
16 pages, 7 figures, 12 tables. Accepted to the ICML 2026 Workshop on Hypothesis Testing, Seoul, South Korea, 2026. Copyright 2026 by the author(s)