基于指令的大语言模型评估文本输入问题能力的分析
计算与语言
2025-09-26 v1 人工智能
摘要
大型语言模型(LLM)可充当评估者,其作用已通过 LLM-as-a-Judge 和微调评估 LLM 等方法得到研究。在教育领域,LLM 已被研究作为学生和教师的助理工具。我们的研究调查了针对学术文本输入问题使用评级标准的 LLM 驱动的自动评估系统。我们提出了五种评估系统,这些系统在由高等教育学生关于计算机科学的 110 个答案组成的自定义数据集上进行了测试,测试对象包括 JudgeLM、Llama-3.1-8B 和 DeepSeek-R1-Distill-Llama-8B。评估系统包括:JudgeLM 评估,该方法使用模型的单一答案提示获取分数;参考辅助评估,该方法在问题的原始上下文之外使用正确答案作为指导;无参考评估,该方法省略参考答案;加法评估,该方法使用原子性标准;自适应评估,该方法使用为每个问题生成的标准进行评估。所有评估方法都与人类评估者的结果进行了比较。结果表明,最佳的自动评估和评分文本输入问题的方法是参考辅助评估。当与人类评估相比,其平均绝对偏差(0.945)最低,均方根偏差(1.214)最低,参考辅助评估提供了公平的评分以及有洞察力和完整的评估。其他方法如加法评估和自适应评估在简洁答案方面未能提供好结果,无参考评估缺乏正确评估问题所需的信息,而 JudgeLM 评估由于模型的局限性未能提供好结果。因此,我们得出结论,人工智能驱动的自动评估系统在采用proper方法论后,显示出作为其他学术资源的补充工具的潜力。
引用
@article{arxiv.2509.20982,
title = {Analysis of instruction-based LLMs' capabilities to score and judge text-input problems in an academic setting},
author = {Valeria Ramirez-Garcia and David de-Fitero-Dominguez and Antonio Garcia-Cabot and Eva Garcia-Lopez},
journal= {arXiv preprint arXiv:2509.20982},
year = {2025}
}