WD-FAB IRT 模型的正则化贝叶斯校准与评分相较边际极大似然提升预测性能
应用统计
2022-05-03 v2 统计方法学
摘要
项目反应理论(IRT)是用于测试响应的主导生成概率模型族背后的统计范式,用于量化个体相对于目标人群的特征。 graded response model(GRM)是一种特定的 IRT 模型,用于有序多分类测试响应。GRM 及其他 IRT 模型的开发与应用均需统计决策。对于构建这些模型(校准),需决定项目选择、推断和正则化的方法。对于应用这些模型(测试评分),需做出类似决策,通常优先考虑计算可处理性和/或可解释性。在许多应用中,如工作残疾功能评估电池(WD-FAB),可处理性意味着使用均值和方差估计来近似个体分数分布,并仅基于校准模型的逐点估计条件获得该分数。在本文中,我们使用贝叶斯交叉验证评估此常见用例下的模型校准与评分。应用于为美国国立卫生研究院收集的 WD-FAB 响应,我们基于其在受访者验证集上产生最能预测项目响应模式的的能力估计,评估了 GRM 实现的预测能力。我们的主要发现表明,GRM 的正则化贝叶斯校准优于无正则化的边际极大似然经验贝叶斯过程。我们还倡导在测试评分中使用紧支撑先验。
引用
@article{arxiv.2010.01396,
title = {Regularized Bayesian calibration and scoring of the WD-FAB IRT model improves predictive performance over marginal maximum likelihood},
author = {Joshua C. Chang and Julia Porcino and Elizabeth K. Rasch and Larry Tang},
journal= {arXiv preprint arXiv:2010.01396},
year = {2022}
}
备注
Revision in review PLOS one