面向学校辍学检测的深度学习:表格模型与图基模型对比预测高风险学生
机器学习
2026-01-16 v1
摘要
学生辍学是全球教育系统面临的重大挑战,导致巨大的社会和经济成本。预测处于辍学风险中的学生可实现及时干预。虽然基于表格数据的传统机器学习模型已显示出前景,但图神经网络(GNN)通过将数据结构化为图形,能够捕捉学生数据中固有的复杂关系,从而具有潜在优势。本文检验了将表格学生数据转换为图结构(主要采用聚类技术)是否能提高辍学预测准确性。我们使用真实的学生数据集,比较了在生成的图上使用的 GNN(自定义图卷积网络(GCN)和 GraphSAGE)与 established tabular models(随机森林(RF)、XGBoost 和 TabNet)的性能。我们的实验探索了基于不同聚类算法(K-Means、HDBSCAN)和降维技术(主成分分析(PCA)、统一谱聚类(UMAP))的各种图构建策略。我们的发现表明,特定的 GNN 配置——基于 PCA-KMeans 聚类构建的 GraphSAGE——实现了最佳性能,显著将宏平均 F1 分数提高约 7 个百分点,将准确率提高近 2 个百分点,超过最强的表格基线模型(XGBoost)。然而,其他 GNN 配置和图构建方法并不总能超越表格模型,这凸显了图生成策略和 GNN 架构选择的关键作用。这既彰显了 GNN 的潜力,也揭示了在该领域将表格数据最佳转化为图基学习方法的挑战。
引用
@article{arxiv.2508.14057,
title = {Deep Learning for School Dropout Detection: A Comparison of Tabular and Graph-Based Models for Predicting At-Risk Students},
author = {Pablo G. Almeida and Guilherme A. L. Silva and Valéria Santos and Gladston Moreira and Pedro Silva and Eduardo Luz},
journal= {arXiv preprint arXiv:2508.14057},
year = {2026}
}
备注
12 pages