ASAG2024:一个简答题评分的综合基准
人工智能
2024-09-30 v1 计算与语言
机器学习
摘要
开放式问题比封闭式问题测试更深入的理解,通常是更受青睐的评估方法。然而,开放式问题评分繁琐且容易受到个人偏见的影响。因此,人们一直致力于通过自动化来加快评分过程。简答题评分(SAG)系统旨在自动为学生答案打分。尽管 SAG 方法和能力不断增长,但目前仍缺乏跨不同学科、评分尺度和分布的综合简答题评分基准。因此,难以评估当前自动评分方法在泛化能力方面的表现。在这项初步工作中,我们引入了综合的 ASAG2024 基准,以促进自动评分系统之间的比较。将七个常用的简答题评分数据集整合为统一的结构和评分尺度。针对我们的基准,我们评估了一组最新的 SAG 方法,结果显示,虽然基于 LLM 的方法达到了新的高分,但仍远未达到人类水平。这为未来人机协同 SAG 系统的研究开辟了道路。
引用
@article{arxiv.2409.18596,
title = {ASAG2024: A Combined Benchmark for Short Answer Grading},
author = {Gérôme Meyer and Philip Breuer and Jonathan Fürst},
journal= {arXiv preprint arXiv:2409.18596},
year = {2024}
}
备注
Accepted at SIGCSE-Virtual 2024