BanditCAT 与 AutoIRT:面向计算机自适应测试与项目校准的机器学习方法
机器学习
2024-10-29 v1 机器学习
应用统计
摘要
本文提出了一个完整的框架,用于在少量作答数据下快速校准并实施稳健的大规模计算机自适应测试(CAT)。校准——即学习测试中的项目参数——通过 AutoIRT 完成,这是一种将自动机器学习(AutoML)与项目反应理论(IRT)相结合的新方法,最初由 [Sharpnack et al., 2024] 提出。AutoIRT 首先利用项目特征训练一个非参数 AutoML 评分模型,随后训练一个项目特定的参数模型,从而得到一个可解释的 IRT 模型。在我们的工作中,我们使用了表格 AutoML 工具(AutoGluon.tabular, [Erickson et al., 2020])以及 BERT 嵌入和基于语言学动机的自然语言处理(NLP)特征。在此框架内,我们使用贝叶斯更新来获取测试者能力后验分布,用于测试实施与评分。对于自适应测试的实施,我们提出了 BanditCAT 框架,该方法源于将问题置于上下文赌博机框架中并利用项目反应理论(IRT)。其核心思想在于,根据 IRT 假设下的潜在测试者能力,将赌博机奖励定义为所选项目的费雪信息量。我们使用汤普森采样来平衡探索具有不同心理测量特性的项目与选择能提供更精确能力信息的高区分度项目。为控制项目曝光率,我们在计算 Fisher 信息量之前,通过一个额外的随机化步骤注入噪声。该框架已被用于在有限训练数据下,于 DET 练习测试中初步推出两种新题型。我们概述了利用此框架的 5 个练习测试实验的一些信度与曝光度指标。
引用
@article{arxiv.2410.21033,
title = {BanditCAT and AutoIRT: Machine Learning Approaches to Computerized Adaptive Testing and Item Calibration},
author = {James Sharpnack and Kevin Hao and Phoebe Mulcaire and Klinton Bicknell and Geoff LaFlair and Kevin Yancey and Alina A. von Davier},
journal= {arXiv preprint arXiv:2410.21033},
year = {2024}
}