中文

BRIDGE:通过跨组数据增强缓解自动评分系统中偏好放大问题

计算与语言 2026-04-21 v2 人工智能

摘要

在教育评估领域,自动化评分系统越来越依赖深度学习和大型语言模型 (LLM)。然而,这些系统面临着显著的偏好放大风险,即模型在不同学生群体之间的预测差距大于训练数据中观察到的差距。 对于像英语语言学习者 (ELL) 这样的少数群体尤其敏感,因为模型可能继承并进一步放大数据中现有的差异。 我们识别到,这一问题与表示偏好密切相关:少数(高得分 ELL)样本的稀缺性使得依赖经验风险最小化训练的模型偏向主流(非 ELL)语言模式。 因此,模型倾向于低估即使在领域知识方面表现相当的 ELL 学生的得分,这些学生使用不同的语言模式,从而削弱了自动化评分结果的公平性。 为了缓解这一问题,我们提出了 BRIDGE,即 Bias-Reducing Inter-group Data GEneration 框架,旨在解决资源有限的评估场景。 我们不依赖有限的少数样本,而是通过将丰富的高得分非 ELL 样本中与评估标准相匹配的知识和证据内容“粘贴”到真实的 ELL 语言模式中来合成高得分 ELL 样本。 我们进一步引入判别器模型以确保合成样本的质量。 在加州科学测试 (CAST) 数据集上的实验表明,BRIDGE 有效地降低了对高得分 ELL 学生的预测偏好,同时保持了整体评分性能。 值得注意的是,我们的方法在获得相当于额外真实人类数据所带来的公平性提升方面取得了相当好的效果,为确保大规模评估中的公平评分提供了一种具有成本效益的解决方案。

关键词

引用

@article{arxiv.2602.23580,
  title  = {BRIDGE the Gap: Mitigating Bias Amplification in Automated Scoring of English Language Learners via Inter-group Data Augmentation},
  author = {Yun Wang and Xuansheng Wu and Jingyuan Huang and Lei Liu and Xiaoming Zhai and Ninghao Liu},
  journal= {arXiv preprint arXiv:2602.23580},
  year   = {2026}
}

备注

15 pages, 1 figure. Accepted as a full paper at AIED 2026