中文

基于深度强化学习的自动评分模型审计

数值分析 2024-05-14 v1 数值分析

摘要

我们探索使用深度强化学习来审计自动短答题评分 (ASAG) 模型。 自动评分可能减少教育者对开放式题目的评估时间负担,但缺乏对这些模型的稳健评估方法会导致其质量不确定性。 当前最先进的 ASAG 模型被配置为匹配来自训练集的人类评分,研究人员通常通过反映模型与人类得分一致性的准确度指标来评估其质量。 本文表明,与人类评分高度一致并不足以证明 ASAG 模型完美无缺。 我们训练一个强化学习智能体,以最少的修订次数获得自动评分模型的高评级为目标。 通过分析获得 ASAG 模型高得分但根据评分标准不会被视为高得分响应的修订后响应,我们发现自动评分器可被利用,暴露了评分模型的短comings。

关键词

引用

@article{arxiv.2405.07086,
  title  = {An enhanced basis for producing Bezier-like curves},
  author = {Bahareh Nouri and Jamshid Saeidian},
  journal= {arXiv preprint arXiv:2405.07086},
  year   = {2024}
}