预测与解释模型可能遗漏教育数据中的信息性特征
统计方法学
2022-01-12 v2 物理教育
摘要
由于高等教育的 demographics 以及我们所提出的问题,我们在教育数据挖掘(EDM)中经常遇到变异很小的变量。然而,鲜有研究考察如何分析此类数据。因此,我们使用逻辑回归、惩罚回归与随机森林进行了仿真研究。我们系统地改变了正结果比例、特征不平衡与优势比。我们发现算法基于特征的不平衡与结果的不平衡,以不同方式处理具有相同优势比的特征。尽管没有算法完全解决如何处理不平衡数据的问题,Firth 与 Log-F 等惩罚方法减小了内置优势比与算法所确定值之间的差异。我们的结果表明,EDM 研究在判定哪些变量与某结果相关时可能存在假阴性。随后我们将发现应用于一个研究生录取数据集。最后我们提出建议:研究者对约数百例的数据集应考虑惩罚回归,并在出版物中纳入更多数据背景信息,如结果不平衡与特征不平衡。
引用
@article{arxiv.2103.14513,
title = {Predictive and explanatory models might miss informative features in educational data},
author = {Nicholas T. Young and Marcos D. Caballero},
journal= {arXiv preprint arXiv:2103.14513},
year = {2022}
}
备注
46 pages, 15 figures, 7 tables