测量 LLM 评估中的所有噪声
机器学习
2026-03-31 v2 人工智能
计算与语言
机器学习
摘要
在实验中将信号与噪声分离是核心任务。将经典统计方法有效应用于 LLM 评估,需要考虑其独特的噪声特征。我们清晰地定义并测量了三类噪声:来自在给定问题上生成不同答案的预测噪声、来自抽样问题的数据噪声,以及遵循总体方差定律的两者合并后的总噪声。为强调相对比较并获得统计功效,我们提出了全配对配对方法,该方法将配对分析应用于所有 LLM 对之间,并基于数以百万计的 question-level 预测在众多评估和设置中测量所有噪声分量,揭示了清晰的模式。首先,每个评估在所有模型对之间都呈现出特征性且高度可预测的总噪声水平。其次,配对预测噪声通常超过配对数据噪声,这意味着通过平均化降低预测噪声可显著提升统计功效。通过综合测量所有噪声,我们可以在上下文中评估评估结果,降低使用最佳分析进行实证决策的门槛。
引用
@article{arxiv.2512.21326,
title = {Measuring all the noises of LLM Evals},
author = {Sida Wang},
journal= {arXiv preprint arXiv:2512.21326},
year = {2026}
}