中文

匹配范例作为下一句预测(MeNSP):科学教育中自动评分的零样本提示学习

计算与语言 2023-11-21 v4 人工智能

摘要

开发模型以自动评分学生对科学问题的书面回答对科学教育至关重要。然而,收集和标注足够的学生回答用于训练模型耗时且昂贵。近期研究表明,预训练语言模型可通过提示适配下游任务而无需微调。但尚无研究在科学教育中采用此类提示方法。由于学生回答以自然语言呈现,将评分过程对齐为使用提示的下一句预测任务可跳过昂贵的微调阶段。在本研究中,我们开发了通过匹配范例作为下一句预测(MeNSP)自动评分学生回答的零样本方法。该方法不使用训练样本。我们首先将 MeNSP 应用于评分三项科学论证评估任务,发现机人评分一致性 Cohen's Kappa 为 0.30 至 0.57,F1 分数为 0.54 至 0.81。为提升性能,我们将研究扩展至少样本设置,随机选取标注学生回答或人工构建回答以微调模型。我们发现一项任务性能随样本增多而提升,Cohen's Kappa 从 0.30 到 0.38,F1 分数从 0.54 到 0.59;其余两项评分性能未提升。我们还发现随机选取的少样本优于人类专家构建方法。本研究表明 MeNSP 可在显著降低成本的同时产出可供参考的学生回答自动评分。该方法有益于科学教育中的低利害课堂评估实践。未来研究应进一步探索 MeNSP 在科学教育不同类型评估任务中的适用性并提升模型性能。

关键词

引用

@article{arxiv.2301.08771,
  title  = {Matching Exemplar as Next Sentence Prediction (MeNSP): Zero-shot Prompt Learning for Automatic Scoring in Science Education},
  author = {Xuansheng Wu and Xinyu He and Tianming Liu and Ninghao Liu and Xiaoming Zhai},
  journal= {arXiv preprint arXiv:2301.08771},
  year   = {2023}
}

备注

10 page + 1 figure