中文

应用大型语言模型与思维链进行自动评分

计算与语言 2024-02-20 v2 人工智能

摘要

本研究探讨了大型语言模型(LLM),特别是 GPT-3.5 和 GPT-4,结合思维链在学生科学评估作答自动评分中的应用。我们着重克服了可及性、技术复杂性和缺乏可解释性等挑战,这些挑战此前限制了基于人工智能的自动评分工具在研究人员和教育工作者中的使用。我们使用包含六项评估任务(三项二分类,三项三分类)和 1,650 份学生作答的测试数据集,采用六种提示工程策略对学生作答进行自动评分。这六种策略将零样本或少样本学习与 CoT 相结合,单独使用或与题干和评分量规一起使用。结果表明,少样本(准确率 = .67)优于零样本学习(准确率 = .60),提升了 12.6%。当不使用题干和评分量规时,CoT 对评分准确率没有显著影响(准确率 = .60)。然而,与上下文题干和量规配合使用的 CoT 提示对评分准确率有显著贡献(零样本提升 13.44%;少样本提升 3.7%)。我们发现,当 CoT 与评分量规一起使用时,不同能力水平类别之间的准确率更加平衡,突出了领域特定推理在增强 LLM 评分任务有效性方面的重要性。我们还发现,当与单次贪心采样或集成投票核采样策略结合使用时,GPT-4 在各项评分任务中表现出优于 GPT-3.5 的性能,差异为 8.64%。特别是,采用 GPT-4 的单次贪心采样策略优于其他方法。

关键词

引用

@article{arxiv.2312.03748,
  title  = {Applying Large Language Models and Chain-of-Thought for Automatic Scoring},
  author = {Gyeong-Geon Lee and Ehsan Latif and Xuansheng Wu and Ninghao Liu and Xiaoming Zhai},
  journal= {arXiv preprint arXiv:2312.03748},
  year   = {2024}
}