中文

仅通过提示工程实现 GPT-3.5 对物理概念问题书面响应的人类水平部分信用评分

物理教育 2024-07-23 v1

摘要

大型语言模型(LLM)因其处理和生成自然语言的能力,在对学生书面响应进行物理问题自动评分方面具有巨大潜力。本探索性研究采用我们命名为“ scaffolded chain of thought(COT)”的提示工程技术,指示GPT-3.5对物理概念问题的学生书面响应进行评分。与常规COT提示相比,scaffolded COT会让GPT-3.5在生成评分结果前,显式地将学生响应与详细且经详尽解释的评分标准进行比较。我们表明,与人类评分员相比,使用scaffolded COT的GPT-3.5评分准确率高出20%-30%。AI与人类评分员之间的一致性可达70%-80%,相当于两个人类评分员之间的一致性。这表明仅通过提示工程技术,基于LLM的AI评分系统有望在物理概念问题上实现人类水平的评分准确率。

关键词

引用

@article{arxiv.2407.15251,
  title  = {Achieving Human Level Partial Credit Grading of Written Responses to Physics Conceptual Question using GPT-3.5 with Only Prompt Engineering},
  author = {Zhongzhou Chen and Tong Wan},
  journal= {arXiv preprint arXiv:2407.15251},
  year   = {2024}
}