大型语言模型中的隐式评分偏差:撰写风格如何影响数学、编程与作文任务的自动评估
计算与语言
2026-03-20 v1
摘要
随着大型语言模型(LLM)在教育领域中作为自动评分工具的部署增多,公平性和评估偏差的问题日益重要。本研究调查了在内容正确性保持不变的情况下,LLM是否存在基于撰写风格的隐式评分偏差。我们构建了一个包含180个学生回答的受控数据集,覆盖三个学科(数学、编程和作文/写作),每个学科包含三种表面级扰动类型:语法错误、非正式语言和非母语表达。两款最先进的开源LLM——LLaMA 3.3 70B(Meta)和Qwen 2.5 72B(Alibaba)——被要求在1-10分的评分尺度上对回答进行评分,明确指示仅评估内容正确性,忽略撰写风格。我们的结果显示,在两个模型和所有扰动类型下,作文/写作任务中存在统计显著的评分偏差(p < 0.05),效应大小范围从中等(Cohen's d = 0.64)到非常大(d = 4.25)。非正式语言受到最重的惩罚,LLaMA扣除平均1.90分,Qwen扣除1.20分——这些惩罚相当于B+到C+成绩等级的差距。非母语表达分别被扣除1.35和0.90分。与此相反,数学和编程任务显示出最小的偏差,大多数条件未达到统计显著性。这些发现表明,LLM评分偏差是学科相关的、风格敏感的,并且即使在评分提示中明确的反偏差指示下仍然存在。我们讨论了部署LLM基于评分系统的公平性问题,并就制定偏差审计协议提出建议。
引用
@article{arxiv.2603.18765,
title = {Implicit Grading Bias in Large Language Models: How Writing Style Affects Automated Assessment Across Math, Programming, and Essay Tasks},
author = {Rudra Jadhav and Janhavi Danve and Sonalika Shaw},
journal= {arXiv preprint arXiv:2603.18765},
year = {2026}
}
备注
7 pages, 5 figures, 2 tables, 11 references