预测早期辍学:校准与算法公平性考量
机器学习
2021-03-17 v1
摘要
本文从算法公平性的角度研究本科学习中辍学风险的预测问题。我们开发了一种机器学习方法来预测大学辍学与会表现不佳的风险。目标是理解此类系统能否在识别高危学生的同时避免潜在的歧视性偏差。在对两类风险建模时,我们基于入学时、即第一学年开始前可用的数据,获得了ROC曲线下面积(AUC)为0.77–0.78的预测模型。该数据包括学生人口统计信息、其就读高中以及其入学(平均)成绩。我们的模型经过校准:它们给出各风险的估计概率,而非单纯分数。我们分析了该方法是否会在预测精度(AUC)与错误率(广义假正率GFPR或广义假负率GFNR)方面对某些敏感群体导致歧视性结果。模型在各群体间表现出AUC与GFNR上的某种公平性。相似的GFNR意味着对辍学学生漏检风险的概率相似。GFPR上的差异通过一种不影响模型校准的缓解过程加以处理。
引用
@article{arxiv.2103.09068,
title = {Predicting Early Dropout: Calibration and Algorithmic Fairness Considerations},
author = {Marzieh Karimi-Haghighi and Carlos Castillo and Davinia Hernandez-Leo and Veronica Moreno Oliver},
journal= {arXiv preprint arXiv:2103.09068},
year = {2021}
}
备注
10 pages, Companion Proceedings 11th International Conference on Learning Analytics & Knowledge (LAK21)