中文

语言模型是少样本评分器

计算与语言 2025-02-20 v1 人工智能

摘要

为学生的作业提供评估是有效学生学习的关键组成部分,而自动化这一过程可以显著减轻人工评分员的工作量。得益于大型语言模型(LLM)的进步,自动简答题评分(ASAG)系统为评估开放式学生回答并提供即时反馈提供了一种有前景的解决方案。在本文中,我们提出了一种利用 SOTA LLM 的 ASAG 流水线。我们新的基于 LLM 的 ASAG 流水线在相同数据集上取得了优于现有定制模型的性能。我们还比较了三种 OpenAI 模型的评分表现:GPT-4、GPT-4o 和 o1-preview。我们的结果表明,GPT-4o 在准确性和成本效益之间取得了最佳平衡。另一方面,o1-preview 尽管准确率较高,但误差方差较大,使其在课堂使用中不够实用。我们研究了使用无示例、随机选择和基于检索增强生成(RAG)的选择策略,将教师评分示例纳入提示词的效果。研究结果表明,提供评分示例能提高评分准确性,且基于 RAG 的选择优于随机选择。此外,整合评分准则通过提供结构化的评估标准进一步提高了准确性。

关键词

引用

@article{arxiv.2502.13337,
  title  = {Language Models are Few-Shot Graders},
  author = {Chenyan Zhao and Mariana Silva and Seth Poulsen},
  journal= {arXiv preprint arXiv:2502.13337},
  year   = {2025}
}