使用Rasch模型检验考试并评估测量不变性
应用统计
2025-10-06 v1
摘要
许多统计学家经常为来自商业、经济、心理学等其他领域的学生教授大型统计、概率或数学讲座课程。相应的考试通常采用多项选择或单项选择格式,并且通常通过扫描纸质试卷或在线学习管理系统进行自动评分。虽然对这些考试进行进一步检验会很有意义,但这些检验通常并未进行。例如,可以使用心理测量学项目反应理论(IRT)模型为题目(或项目)的难度和学生的能力建立测量尺度。此外,基于这样的模型,可以评估考试对所有参与者是否真正公平,或者某些题目对特定学生子群体是否更容易(或更难)。本文讨论并应用了几种最新的方法,用于评估Rasch IRT模型中的测量不变性和检测题目功能差异,并将其应用于一门一年级数学考试(采用单项选择题目)的结果。性别、先前经验和先前数学知识等几个分类、有序和数值协变量可用于定义可能存在题目功能差异的子群体。具体而言,所有分析均通过使用psycho*系列R包(psychotools、psychotree、psychomix)的实操R教程进行演示,这些包提供了一种统一的方法来估计、可视化、检验、混合和划分一系列心理测量模型。本文谨以此献给Fritz Leisch(1968-2024)的纪念,并强调他对这项工作的各个方面所做的贡献。
引用
@article{arxiv.2409.19522,
title = {Examining Exams Using Rasch Models and Assessment of Measurement Invariance},
author = {Achim Zeileis},
journal= {arXiv preprint arXiv:2409.19522},
year = {2025}
}
备注
19 pages, 7 figures