SAS-Bench:一个用于评估大语言模型短答案评分的细粒度基准
计算与语言
2025-05-16 v2 人工智能
摘要
主观答案评分(SAG)在教育、标准化测试和自动评估系统中扮演着关键角色,尤其是在短答案评分(SAS)中评估简答题回答时。然而,现有方法通常产生粗粒度的分数,且缺乏详细的推理过程。尽管大语言模型(LLMs)已展现出作为零样本评估器的潜力,但它们仍然容易受到偏见、与人类判断不一致以及评分决策透明度有限的影响。为了克服这些局限性,我们引入了SAS-Bench,一个专为基于LLM的SAS任务设计的基准。SAS-Bench提供了细粒度的、分步的评分、专家标注的错误类别,以及源自真实学科特定考试的多样化问题类型。该基准有助于对模型推理过程和可解释性进行详细评估。我们还发布了一个包含1,030个问题和4,109份学生答案的开源数据集,每份答案均由领域专家标注。此外,我们对各种LLM进行了全面的实验,识别了在评分科学相关问题方面的主要挑战,并强调了少样本提示在提高评分准确性方面的有效性。我们的工作为开发更稳健、更公平且具有教育意义的基于LLM的评估系统提供了宝贵的见解。
引用
@article{arxiv.2505.07247,
title = {SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models},
author = {Peichao Lai and Kexuan Zhang and Yi Lin and Linyihan Zhang and Feiyang Ye and Jinhao Yan and Yanwei Xu and Conghui He and Yilei Wang and Wentao Zhang and Bin Cui},
journal= {arXiv preprint arXiv:2505.07247},
year = {2025}
}