整体型与分析型评分量规下的大语言模型作文评分:提示效应与偏差
计算与语言
2026-04-02 v1 人工智能
摘要
尽管越来越多的人关注将大语言模型(LLMs)用于教育评估,但尚不清楚它们与人类评分的吻合程度。我们对三个开放作文评分数据集(ASAP 2.0、ELLIPSE和DREsS)中的指令微调LLMs进行了系统评估,这些数据集涵盖了整体型和分析型评分。我们分析了与人类共识评分的一致性、方向性偏差以及偏差估计的稳定性。我们的结果表明,强大的开源权重模型在整体型评分上与人类达到了中等至高度一致(二次加权Kappa约0.6),但这种一致性并非均匀地转移到分析型评分。特别地,我们观察到在低阶关注(LOC)特征(如语法和规范)上存在显著且稳定的方向性负偏差,这意味着模型对这些特征的评分往往比人类评分者更为严苛。我们还发现,在多特征分析型评分中,简明的基于关键词的提示通常优于较长的量规式提示。为了量化检测这些系统性偏差所需的数据量,我们计算了平均偏差的95%自助置信区间排除零的最小样本量。该分析表明,LOC偏差通常可以用很小的验证集检测到,而高阶关注(HOC)特征通常需要更大的样本。这些发现支持以偏差校正为先的部署策略:与其依赖原始零样本评分,不如使用小规模人工标注的偏差估计集来估计和校正系统性评分偏移,而无需进行大规模微调。
引用
@article{arxiv.2604.00259,
title = {LLM Essay Scoring Under Holistic and Analytic Rubrics: Prompt Effects and Bias},
author = {Filip J. Kucia and Anirban Chakraborty and Anna Wróblewska},
journal= {arXiv preprint arXiv:2604.00259},
year = {2026}
}