中文

自动问题可用性评估工具包

人工智能 2024-06-03 v1 计算与语言

摘要

评估多项选择题(MCQ)涉及劳动密集型的人工评估或优先考虑可读性的自动化方法,往往忽略了更深层次的问题设计缺陷。为了解决这个问题,我们引入了可扩展的自动问题可用性评估工具包(SAQUET),这是一个开源工具,利用项目编写缺陷(IWF)标准对MCQ进行全面自动的质量评估。通过利用最新的大型语言模型(如GPT-4)、高级词嵌入和旨在分析文本复杂性的Transformer,SAQUET有效地识别和评估MCQ中的各种缺陷。我们首先展示了常用自动评估指标与人类对MCQ质量评估之间的差异。然后,我们在化学、统计学、计算机科学、人文学科和医疗保健五个领域的多样化MCQ数据集上评估SAQUET,展示了它如何有效区分有缺陷和无缺陷的问题,提供了超越传统指标的分析水平。在检测人类评估者识别的缺陷存在方面,准确率超过94%,我们的发现强调了现有评估方法的局限性,并展示了提高教育评估质量的潜力。

关键词

引用

@article{arxiv.2405.20529,
  title  = {An Automatic Question Usability Evaluation Toolkit},
  author = {Steven Moore and Eamon Costello and Huy A. Nguyen and John Stamper},
  journal= {arXiv preprint arXiv:2405.20529},
  year   = {2024}
}

备注

Artificial Intelligence in Education 2024