仅通过提示工程实现 GPT-3.5 对物理概念问题书面响应的人类水平部分信用评分
物理教育
2024-07-23 v1
摘要
大型语言模型(LLM)因其处理和生成自然语言的能力,在对学生书面响应进行物理问题自动评分方面具有巨大潜力。本探索性研究采用我们命名为“ scaffolded chain of thought(COT)”的提示工程技术,指示GPT-3.5对物理概念问题的学生书面响应进行评分。与常规COT提示相比,scaffolded COT会让GPT-3.5在生成评分结果前,显式地将学生响应与详细且经详尽解释的评分标准进行比较。我们表明,与人类评分员相比,使用scaffolded COT的GPT-3.5评分准确率高出20%-30%。AI与人类评分员之间的一致性可达70%-80%,相当于两个人类评分员之间的一致性。这表明仅通过提示工程技术,基于LLM的AI评分系统有望在物理概念问题上实现人类水平的评分准确率。
引用
@article{arxiv.2407.15251,
title = {Achieving Human Level Partial Credit Grading of Written Responses to Physics Conceptual Question using GPT-3.5 with Only Prompt Engineering},
author = {Zhongzhou Chen and Tong Wan},
journal= {arXiv preprint arXiv:2407.15251},
year = {2024}
}