中文

利用GPT-4与基于规则的方法评估选择题质量

计算与语言 2023-07-18 v1 人工智能 人机交互

摘要

存在题目编写缺陷的选择题会对学生学习产生负面影响并扭曲分析数据。这些缺陷常出现在学生生成的问题中,使其质量和适用于课堂使用的评估变得困难。现有评估选择题的方法常聚焦于机器可读性指标,而未考虑其在课程材料中的预期用途及其教学意义。在本研究中,我们将自研的基于规则的方法与利用GPT-4的基于机器学习的方法进行比较,任务是基于19种常见题目编写缺陷自动评估选择题。通过分析来自四个不同学科领域的200道学生生成问题,我们发现基于规则的方法正确检测了人类标注者识别缺陷的91%,而GPT-4为79%。我们展示了两种方法在识别不同学科领域学生生成问题中常见题目编写缺陷的有效性。基于规则的方法能准确高效地评估来自多个领域的选择题,优于GPT-4,并超越了未考虑此类问题教育用途的现有指标。最后,我们讨论了利用这些自动化方法基于已识别缺陷提升问题质量的潜力。

关键词

引用

@article{arxiv.2307.08161,
  title  = {Assessing the Quality of Multiple-Choice Questions Using GPT-4 and Rule-Based Methods},
  author = {Steven Moore and Huy A. Nguyen and Tianying Chen and John Stamper},
  journal= {arXiv preprint arXiv:2307.08161},
  year   = {2023}
}

备注

Accepted as a Research Paper in 18th European Conference on Technology Enhanced Learning