评估AI生成问题在教育评估认知框架中的对齐性
摘要
本研究评估了将布卢姆分类学整合到OneClickQuiz中的效果——这是一个用于自动化生成多选题(MCQ)的AI驱动Moodle插件。布卢姆分类学提供了将教育目标分为层次化认知水平的结构化框架。我们的研究探讨了将此分类学纳入AI生成问题中是否可提高其与特定认知目标的对齐性。我们构建了一个包含3691个按布卢姆水平分类的问题数据集,并采用多项逻辑回归、朴素贝叶斯、线性支持向量分类(SVC)以及基于Transformer的模型(DistilBERT)来评估其在分类问题中的有效性。我们的结果表明,较高的布卢姆水平通常与问题长度、布卢姆-金约克年级水平(FKGL)和词汇密度(LD)增加相关,这反映了更高认知需求的复杂性。多项逻辑回归在不同布卢姆水平上的准确率有所不同,针对"知识"水平表现最佳,但针对更高阶水平表现较差。合并更高阶类别可提高复杂认知任务的准确率。朴素贝叶斯和线性SVC也显示出对低阶水平有效分类,但在处理高阶任务时表现不佳。DistilBERT实现了最佳性能,显著提升了对低阶和高阶认知水平的分类,实现整体验证准确率达91%。本研究凸显了将布卢姆分类学整合到AI驱动评估工具中的潜力,强调了像DistilBERT这样的先进模型在提升教育内容生成方面的优势。
关键词
引用
@article{arxiv.2504.14232,
title = {Assessing AI-Generated Questions' Alignment with Cognitive Frameworks in Educational Assessment},
author = {Antoun Yaacoub and Jérôme Da-Rugna and Zainab Assaghir},
journal= {arXiv preprint arXiv:2504.14232},
year = {2025}
}
备注
This paper was presented in the 17th Int. Conf. on Computer Science and Information Technology (ICCSIT 2024), Dubai, United Arab Emirates, 2024, Oct. 23-25. IT was published in the International Journal of Computer Theory and Engineering, vol. 17, no. 3, pp. 114-125, 2025