Grade Guard:短答题自动评分的智能系统
计算与语言
2025-04-03 v1
摘要
大型语言模型(LLM)的出现在教育领域为自动化对短答题进行评分提供了动力。LLM 能够高效地评估短答案,从而解决了人手不足等问题。然而,在自动短答题评分(ASAG)任务中,LLM 的响应受到其训练数据集中不同观点影响,导致对细微或部分正确答案的评估不准确。在挑战性问题的解决方面,我们提出了一种新框架 Grade Guard。1. 为增强 LLM 的任务特定专化,已使用根均方误差(RMSE)对温度参数进行微调。2. 与传统方法不同,Grade Guard 中的 LLM 除了计算分数外,还计算一个不可决策分数(Indecisiveness Score, IS),以反映预测分数不确定性。3. 引入置信感知损失(Confidence-Aware Loss, CAL)以生成优化后的 IS。4. 为提高可靠性,已在框架中引入基于优化后 IS 的自反思,使人类能够进行重新评估,以最小化错误的评分分配。我们的实验表明,Grade Guard 最佳设置在 Upstage Solar Pro、Upstage Solar Mini、Gemini 1.5 Flash 和 GPT 4-o Mini 上的 RMSE 分别提高了 19.16%、23.64%、4.00% 和 10.20%。未来工作包括通过生成评分理由来提高可解释性,从而提高准确性。扩大基准数据集并用领域特定细微差别进行注释将提高评分准确性。最终,分析反馈以提高对预测分数的信心,减少偏见,优化评分标准,并支持多语言评分系统,将使解决方案在准确性、适应性、公平性和包容性方面更为出色。
引用
@article{arxiv.2504.01253,
title = {Grade Guard: A Smart System for Short Answer Automated Grading},
author = {Niharika Dadu and Harsh Vardhan Singh and Romi Banerjee},
journal= {arXiv preprint arXiv:2504.01253},
year = {2025}
}
备注
11 pages, 18 figures