人工智能对英语学习者的偏见:基于自动评分系统的研究
计算与语言
2025-05-21 v2 人工智能
计算机与社会
摘要
本研究考察了使用自动评分系统对中学生科学评估书面作答时,对英语学习者(English Language Learners, ELLs)的潜在评分偏见和差异。我们特别关注不平衡训练数据中包含 ELLs 的情况对评分偏见和差异的贡献。我们对 BERT 模型进行微调,使用四个数据集进行训练:(1) 来自 ELLs 的作答、(2) 来自非 ELLs 的作答、(3) 反映真实世界中 ELLs 与非 ELLs 比例的混合数据集(不平衡)、以及 (4) 两组代表平等的混合数据集。该研究分析了 21 项评估题目:10 项约有 30,000 份 ELL 作答、5 项约有 1,000 份 ELL 作答,以及 6 项约有 200 份 ELL 作答。计算并比较评分准确率(Acc),以识别偏见,使用 Friedman 检验。我们测量了 ELLs 与非 ELLs 之间的平均得分差(MSGs),随后计算通过人类和 AI 模型生成的 MSG 差异,以识别评分差异。我们发现,在训练数据集足够大时(ELL = 30,000 且 ELL = 1,000),不存在 AI 偏见和 ELLs 与非 ELLs 之间的扭曲差异,但如果样本量有限(ELL = 200),则可能存在顾虑。
引用
@article{arxiv.2505.10643,
title = {Artificial Intelligence Bias on English Language Learners in Automatic Scoring},
author = {Shuchen Guo and Yun Wang and Jichao Yu and Xuansheng Wu and Bilgehan Ayik and Field M. Watts and Ehsan Latif and Ninghao Liu and Lei Liu and Xiaoming Zhai},
journal= {arXiv preprint arXiv:2505.10643},
year = {2025}
}