一种利用大语言模型的思维链提示方法评估学生科学形成性评价作答
计算与语言
2024-05-02 v1
摘要
本文探索使用大语言模型(LLMs)对 K-12 科学教育中的简答题评估进行评分和解释。现有方法虽能对结构性更强的数学和计算机科学评估进行评分,但通常不提供评分解释。我们的研究聚焦于运用 GPT-4 进行初中地球科学的自动化评估,结合少样本学习、主动学习与思维链推理。通过采用人在回路的方法,我们成功地对形成性评价作答进行了评分并提供了有意义的解释。对该方法优缺点的系统分析揭示了人在回路技术在增强开放式科学评估自动评分方面的潜力。
引用
@article{arxiv.2403.14565,
title = {A Chain-of-Thought Prompting Approach with LLMs for Evaluating Students' Formative Assessment Responses in Science},
author = {Clayton Cohn and Nicole Hutchins and Tuan Le and Gautam Biswas},
journal= {arXiv preprint arXiv:2403.14565},
year = {2024}
}
备注
In press at EAAI-24: The 14th Symposium on Educational Advances in Artificial Intelligence