中文

Ratas 框架:一种基于生成式 AI 的真实文本考试评分量规评分综合方法

计算与语言 2025-06-02 v1

摘要

自动答案评分是教育技术中的一个关键挑战,具有简化评估流程、确保评分一致性以及向学生提供及时反馈的潜力。然而,现有方法通常局限于特定的考试格式,在分数分配上缺乏可解释性,并且在跨不同学科和评估类型的真实世界适用性方面存在困难。为了解决这些局限性,我们引入了 RATAS(基于评分量规的自动化树状答案评分,Rubric Automated Tree-based Answer Scoring),这是一种利用 SOTA 生成式 AI 模型对文本回答进行基于评分量规评分的新颖框架。RATAS 旨在支持广泛的评分量规,实现与学科无关的评估,并为分配的分数生成结构化、可解释的理由。我们通过一个为基于评分量规的评估量身定制的数学框架将自动评分任务形式化,并提出了一种能够处理复杂的真实世界考试结构的架构。为了严格评估我们的方法,我们构建了一个独特的、情境化的数据集,该数据集源自真实世界的基于项目的课程,包含多样的回答格式和不同程度的复杂性。实证结果表明,RATAS 在自动评分中实现了高可靠性和准确性,同时提供了可解释的反馈,从而提高了学生和教师的透明度。

关键词

引用

@article{arxiv.2505.23818,
  title  = {Ratas framework: A comprehensive genai-based approach to rubric-based marking of real-world textual exams},
  author = {Masoud Safilian and Amin Beheshti and Stephen Elbourn},
  journal= {arXiv preprint arXiv:2505.23818},
  year   = {2025}
}