教育数据挖掘中的集中式与联邦学习:基于SAEB微数据的学生表现预测比较研究
机器学习
2025-09-03 v1 计算机与社会
摘要
数据挖掘与人工智能在教育领域的应用为个性化学习与早期识别高风险学生提供了前所未有的潜力。然而,受巴西通用数据保护法(LGPD)等隐私立法限制,敏感学生数据集中存储面临重大障碍。为解决此问题,需采用隐私保护计算方法。本文评估了联邦学习(具体为FedProx算法)在预测基于SAEB(巴西基础教育评估系统)微数据的学生表现方面的可行性与效果。训练了一个以联邦方式进行的深度神经网络(DNN)模型,模拟50所学校的场景,并严格对比了集中式极端梯度提升(XGBoost)模型。分析显示,集中式模型准确率达63.96%,而联邦模型峰值准确率达61.23%,展现出在提供稳健隐私保障下仅略微的性能损失。结果表明,联邦学习是巴西教育语境下构建协作预测模型的可行且有效的方法,符合LGPD要求。
引用
@article{arxiv.2509.00086,
title = {Centralized vs. Federated Learning for Educational Data Mining: A Comparative Study on Student Performance Prediction with SAEB Microdata},
author = {Rodrigo Tertulino},
journal= {arXiv preprint arXiv:2509.00086},
year = {2025}
}
备注
This paper has been prepared to be submitted Brazilian Journal of Informatics in Education - RBIE