谁将从大学退学?基于可解释机器学习的学业风险预测
机器学习
2021-12-03 v1 机器学习
摘要
在院校研究模式下,为从具有高分维、不平衡分类小样本特征的学生行为数据集中探索哪些特征可作为预测学业风险的最佳指标,将大学生学业风险预测转化为二分类任务。其基于 LightGBM 模型与 Shapley 值的可解释机器学习方法预测学业风险。仿真结果表明,从预测模型的全局视角看,学业伙伴质量、课堂座位位置、宿舍学习氛围、高考英语成绩、学业伙伴数量、电子游戏成瘾程度、学业伙伴流动性以及逃课程度是学业风险最佳的 8 个预测因子。与直觉相反,在本实验中,是否住校、勤工俭学、口红成瘾、是否学生干部、恋爱对象数量以及吸烟等特征与大学学业风险相关性很小。从样本的局部视角看,影响学业风险的因素因人而异。其可通过 Shapley 值进行个性化可解释分析,这是传统数理统计预测模型无法做到的。本研究的学术贡献主要在两方面:第一,首次提出学习交互网络,使社交行为可用于弥补个体行为的片面性并提升学业风险预测性能。第二,引入 Shapley 值计算使缺乏明确推理过程的机器学习得以可视化,并为教育管理者提供直观决策支持。
引用
@article{arxiv.2112.01079,
title = {Who will dropout from university? Academic risk prediction based on interpretable machine learning},
author = {Shudong Yang},
journal= {arXiv preprint arXiv:2112.01079},
year = {2021}
}
备注
15 pages,7 figures