通过教育评估中的序数置信度建模提升评分准确度
计算与语言
2025-12-15 v1 人工智能
机器学习
摘要
自动作文评分 (AES) 中的一个关键伦理挑战是确保仅在分数达到高可靠性标准时才予以发布。置信度建模通过为每个自动评分分配一个置信度分数形式的可靠性估计度量来解决这一问题。在本研究中,我们将置信度估计构建为一个分类任务:预测 AES 生成的分数是否将考生正确地划分到相应的 CEFR 等级。尽管这是一个二元决策,我们通过两种方式利用评分域固有的粒度。首先,我们使用分数分箱将任务重新表述为 n 元分类问题。其次,我们引入了一组新颖的核加权序数分类交叉熵 (KWOCCE) 损失函数,该函数结合了 CEFR 标签的序数结构。我们表现最佳的模型达到了 0.97 的 F1 分数,并使系统能够发布 47% 具有 100% CEFR 一致性的分数,以及 99% 具有至少 95% CEFR 一致性的分数——相比之下,在发布所有 AM 预测分数的独立 AES 模型中,CEFR 一致性约为 92%。
引用
@article{arxiv.2505.23315,
title = {Enhancing Marker Scoring Accuracy through Ordinal Confidence Modelling in Educational Assessments},
author = {Abhirup Chakravarty and Mark Brenchley and Trevor Breakspear and Ian Lewin and Yan Huang},
journal= {arXiv preprint arXiv:2505.23315},
year = {2025}
}
备注
This is the preprint version of our paper accepted to ACL 2025 (Industry Track). The DOI will be added once available