中文

基于分析的教育 LLM 基准测试:关于反馈中的性别偏见的案例研究

计算与语言 2026-04-02 v2 人工智能 计算机与社会 人机交互

摘要

随着教师越来越多地使用生成式 AI 在其教育实践中,我们需要 robust 方法来评估大型语言模型(LLM)以进行教育目的。本文提出一种基于嵌入的基准测试框架,用于检测 LLM 在形成性反馈背景下的偏见。我们使用来自 AES 2.0 语料库的 600 篇真实学生作文,构建了沿两个维度的受控反事实情形:i) 通过词典方法替换作文中性别化术语的隐式线索;ii) 通过性别化作者背景的提示中的显式线索。我们调查了六个具有代表性的 LLM(即 GPT-5 mini、GPT-4o mini、DeepSeek-R1、DeepSeek-R1-Qwen、Gemini 2.5 Pro、Llama-3-8B)。我们首先用余弦和欧几里得距离量化响应差异,然后通过置换检验评估显著性,最后使用降维可视化结构。在所有模型中,隐式操作可靠地引起男性-女性反事实情形的语义偏移大于女性-男性反事实情形。只有 GPT 和 Llama 模型显示出对显式性别线索的敏感性。这些发现表明,即使是最先进的 LLM,也对性别替换表现出不对称的语义响应,暗示了他们在提供给学习者的反馈中仍然存在持久的性别偏见。定性分析进一步揭示了一致的语言差异(例如,在男性线索下更支持自主性的反馈 vs. 在女性线索下更具控制性的反馈)。我们讨论了对教育生成式 AI 公平性审计的影响,提出了关于学习分析中反事实评估报告标准的建议,并概述了针对提示设计和部署的实用指导,以保障公平的反馈。

关键词

引用

@article{arxiv.2511.08225,
  title  = {Benchmarking Educational LLMs with Analytics: A Case Study on Gender Bias in Feedback},
  author = {Yishan Du and Conrad Borchers and Mutlu Cukurova},
  journal= {arXiv preprint arXiv:2511.08225},
  year   = {2026}
}

备注

21 pages, 7 figures