利用 AI 评分器进行缺失得分插补以实现构建回答测试中的准确能力估计
计算与语言
2025-06-26 v1 机器学习
摘要
评估学习者能力是教育领域的基本目标。特别是,对更高阶能力的评估需求日益增长,如表达技能和逻辑思维能力。构建回答测试(如短答题和论文题)因能满足这一需求而广泛应用。虽然这些测试有效,但需要大量的人工批改,既费时又昂贵。项目反应理论(IRT)提供了可行的解决方案,通过从不完整的得分数据中估计能力,其中人类评分员只对学习者在多个测试项目中提供的答案子集进行评分。然而,随着缺失得分比例的增加,能力估计的准确性会下降。虽然已探索了数据增强技术来插补缺失得分,但常常在稀疏或异构数据上存在不准确的问题。为克服这些挑战,本研究提出了一种 novel 方法,通过利用自动评分技术对缺失得分进行插补,以实现准确的 IRT 基于能力估计。该方法在保持高准确性的同时,显著减少了人工批改的工作量。
引用
@article{arxiv.2506.20119,
title = {Leveraging AI Graders for Missing Score Imputation to Achieve Accurate Ability Estimation in Constructed-Response Tests},
author = {Masaki Uto and Yuma Ito},
journal= {arXiv preprint arXiv:2506.20119},
year = {2025}
}
备注
Accepted to EvalLAC'25: 2nd Workshop on Automatic Evaluation of Learning and Assessment Content, held at AIED 2025, Palermo, Italy. This is the camera-ready version submitted to CEUR Workshop Proceedings