偏斜评分:评估自动评分器的统计框架
机器学习
2026-02-27 v3 机器学习
摘要
大型语言模型(LLM)输出的评估越来越多地由其他LLM执行,这种设置通常被称为“LLM-as-a-judge”或自动评分器。虽然自动评分器提供了人类评估的可扩展替代方案,但它们表现出混合的可靠性,并且可能根据响应类型、评分方法、领域特异性或其他因素表现出系统性偏差。在这里,我们提出了一个基于贝叶斯广义线性模型(GLMs)的统计框架,使研究人员能够同时评估他们的自动评分器,同时解决他们的主要研究问题(例如,LLM评估)。我们的方法将评估结果(例如,分数或成对偏好)建模为评分者属性(例如,人类vs.自动评分器)和被评估项目属性(例如,响应长度或生成它的LLM)的函数,允许在统一框架内明确量化评分差异和潜在偏差。此外,我们的方法可用于增强传统指标,如评分者间一致性,通过提供不确定性估计和澄清分歧来源。总的来说,这种方法有助于在LLM评估中更稳健和可解释地使用自动评分器,实现性能分析和偏差检测。
引用
@article{arxiv.2507.03772,
title = {Skewed Score: A statistical framework to assess autograders},
author = {Magda Dubois and Harry Coppock and Mario Giulianelli and Timo Flesch and Lennart Luettgau and Cozmin Ududec},
journal= {arXiv preprint arXiv:2507.03772},
year = {2026}
}