使用 LLM 评估学生的开放式书面回答:基于 RAG 框架的 GPT-3.5、GPT-4、Claude-3 与 Mistral-Large
计算与语言
2024-05-10 v1 人工智能
摘要
评估学生的开放式书面考试回答是教育工作者的一项重要且耗时的任务,需要投入大量精力并保持高度的一致性与精确性。大语言模型(LLM)的最新进展为在全面评估与高效利用教育工作者时间之间取得平衡提供了充满前景的机遇。在我们的研究中,我们探讨了 LLM ChatGPT-3.5、ChatGPT-4、Claude-3 和 Mistral-Large 在评估大学生针对其所学参考资料提出问题的开放式回答方面的有效性。每个模型被指示在两种条件下重复评估 54 份回答:温度参数设为 0.0 进行 10 次(10-shot)评估,以及温度参数设为 0.5 进行 10 次评估,预计每个模型共计 1,080 次评估,所有模型共计 4,320 次评估。采用 RAG(检索增强生成)框架作为基础框架,使 LLM 能够处理对回答的评估。截至 2024 年春季,我们的分析揭示了所研究的 LLM 在一致性及评分结果方面存在显著差异。有必要深入了解 LLM 在教育场景中评估开放式书面回答的优势与不足。进一步开展比较研究对于确定将 LLM 用于教育评估的准确性与成本效益至关重要。
引用
@article{arxiv.2405.05444,
title = {Evaluating Students' Open-ended Written Responses with LLMs: Using the RAG Framework for GPT-3.5, GPT-4, Claude-3, and Mistral-Large},
author = {Jussi S. Jauhiainen and Agustín Garagorry Guerra},
journal= {arXiv preprint arXiv:2405.05444},
year = {2024}
}
备注
18 pages, 6 tables, 1 figure