中文

基于提示的大型语言模型是否识别学生的人口统计学特征并在作文评分中引入偏见?

计算与语言 2025-05-01 v1

摘要

大型语言模型(LLMs)因其能够捕捉语义含义而广泛应用于自动作文评分(AES)。传统的微调方法需要专业技术知识,这限制了缺乏技术背景的教育者的可及性。然而,基于提示的工具如ChatGPT使AES更加易于访问,使教育者能够使用自然语言提示获取机器生成的评分。尽管取得了进展,但先前的研究表明,针对弱势群体的微调LLMs存在偏见。仍不清楚这种偏见是否在基于提示的范式中延续或放大。由于这种偏见被认为源于预训练模型中嵌入的人口统计学信息(即LLM文本嵌入预测人口统计学属性的能力),本研究探讨了模型基于其书面作品预测学生人口统计学属性的能力与其评分任务中偏见预测能力之间的关系。在一个包含超过25,000篇学生论辩作文的公开数据集上,我们设计了提示词,以从GPT-4o中引导人口统计学推断(即性别、母语背景),并评估了自动评分中的公平性。随后我们进行了多变量回归分析,以探讨模型预测人口统计学能力对其评分结果的影响。我们的发现表明:(i)基于提示的LLMs能够从作文中一定程度地推断学生的人口统计学特征,尤其是其母语背景;(ii)当LLM正确预测学生的母语背景时,评分偏差比未预测时更为显著;(iii)当LLM正确识别非母语为英语的学生时,非母语为英语的学生的评分误差会增加。

关键词

引用

@article{arxiv.2504.21330,
  title  = {Does the Prompt-based Large Language Model Recognize Students' Demographics and Introduce Bias in Essay Scoring?},
  author = {Kaixun Yang and Mladen Raković and Dragan Gašević and Guanliang Chen},
  journal= {arXiv preprint arXiv:2504.21330},
  year   = {2025}
}