SteLLA:一种基于RAG的LLM结构化评分系统
计算与语言
2025-05-26 v1 人工智能
计算机与社会
摘要
大型语言模型(LLM)在许多应用中展现出强大的通用能力。然而,如何使它们成为某些特定任务(如自动简答题评分(ASAG))的可靠工具仍然是一个挑战。我们提出了SteLLA(基于RAG的LLM结构化评分系统),其中a)采用检索增强生成(RAG)方法,通过从教师提供的参考答案和评分标准中提取高度相关且可靠的外部知识中的结构化信息,专门增强LLM在ASAG任务上的能力;b)LLM对学生答案进行结构化的、基于问答的评估,提供分析性评分和反馈。我们从一门大学水平的生物学课程中收集了一个包含学生考试答案的真实世界数据集。实验表明,我们提出的系统能够与人类评分者达到实质性一致,同时提供问题所考查的所有知识点的细分评分和反馈。对GPT4生成的反馈进行的定性和错误分析表明,GPT4善于捕捉事实,但在评分任务中可能倾向于从给定文本中推断过多含义,这为LLM在ASAG系统中的应用提供了见解。
引用
@article{arxiv.2501.09092,
title = {SteLLA: A Structured Grading System Using LLMs with RAG},
author = {Hefei Qiu and Brian White and Ashley Ding and Reinaldo Costa and Ali Hachem and Wei Ding and Ping Chen},
journal= {arXiv preprint arXiv:2501.09092},
year = {2025}
}