用于学生心理健康疾病评估的机器学习模型实证比较
应用统计
2022-03-01 v1
摘要
此前高等教育文献已在多种情境下探讨学生心理健康问题,包括涉及定量与定性方法的实证工作。然而,旨在以计算方法直接从数据中学习信息、而不依赖为预定方程设定参数的分析方法的相对研究较少。本研究旨在考察高等教育中使用的机器学习(ML)模型的性能。所考虑的 ML 模型包括朴素贝叶斯、支持向量机、K近邻、逻辑回归、随机梯度下降、决策树、随机森林、XGBoost(极端梯度提升决策树)以及 NGBoost(自然梯度提升)算法。考虑学生心理健康疾病的影响因素,我们遵循数据处理的三个阶段:分割、特征提取与分类。我们依据准确率、精确率、召回率、F1 分数和预测运行时间等分类性能指标对这些 ML 模型进行评估。实证分析包含两方面贡献:1. 考察了多种 ML 模型在基于调查的教育数据集上的性能,推断出基于树的 XGBoost 算法具有显著的分类性能;2. 探究了数据集中的特征重要性[变量],推断出社会支持、学习环境与童年逆境对学生心理健康疾病具有显著重要性。
引用
@article{arxiv.2202.13495,
title = {An empirical comparison of machine learning models for student's mental health illness assessment},
author = {Prathamesh Muzumdar and Ganga Prasad Basyal and Piyush Vyas},
journal= {arXiv preprint arXiv:2202.13495},
year = {2022}
}