题目撰写缺陷对项目难度与区分度的影响:基于项目反应理论
计算与语言
2025-08-08 v3 人工智能
计算机与社会
摘要
高质量的测试题目是教育评估的关键,尤其是在项目反应理论(IRT)中。传统的验证方法依赖资源密集的试点测试来估计题目的难度和区分度。更近期地,题目撰写缺陷(IWF)评级表作为一种基于文本特征的评估方法,涌现为一种用于评估测试题目的领域通用方法。这一方法提供了一种无需学生数据即可进行的可扩展的部署前评估,但其关于经验 IRT 参数的预测有效性尚未充分探讨。为弥补这一差距,我们进行了一项研究,涉及 7,126 个跨多个 STEM 学科(物理科学、数学和生命/地球科学)的多选题。我们采用自动化方法,对每道题目按照 19 项标准的 IWF 评级表进行标注,并研究其与数据驱动 IRT 参数之间的关系。我们的分析揭示了 IWF 数量与 IRT 难度和区分度参数之间存在统计显著的关联,尤其是在生命/地球科学和物理科学领域。我们进一步观察到,特定的 IWF 标准对题目质量的影响程度不同(例如,负面表述与不合情理的干扰项),以及它们如何使题目更具或更少挑战性。总体而言,我们的发现确立了自动化 IWF 分析作为传统验证方法的有价值的补充,为初始题目筛选提供了一种高效的方法,尤其适用于标记难度较低的多选题。我们的发现表明,针对领域通用评级表和能够理解领域特定内容的算法进行稳健题目验证的进一步研究仍有必要。
引用
@article{arxiv.2503.10533,
title = {The Impact of Item-Writing Flaws on Difficulty and Discrimination in Item Response Theory},
author = {Robin Schmucker and Steven Moore},
journal= {arXiv preprint arXiv:2503.10533},
year = {2025}
}
备注
Added Acknowledgments