基于经验边际分布的稳定隐私保护教育合成数据:Copula 方法
机器学习
2026-04-07 v1 计算机与社会
摘要
为推进受严格隐私保护监管框架约束下的教育数据挖掘(EDM),研究者必须开发方法,在保护敏感学生信息的前提下实现数据驱动分析。合成数据生成是一种可行方法,通过释放统计上生成的样本而非真实学生记录来实现隐私保护;然而,现有的深度学习和参数化生成方法常导致边际分布失真,在迭代再生过程中性能恶化,引发分布漂移和分布支持的逐步丢失,影响可靠性。为此,我们提出非参数高斯 Copula(NPGC),一种即插即用的合成方法,取代深度学习和参数化优化,采用经验统计锚定保留观察到的边际分布,同时通过 Copula 框架建模变量间依赖关系。NPGC 在边际和相关水平集成差分隐私(DP),支持异构变量类型,将缺失数据视为显式状态以保留信息丰富的缺失模式。我们在五个基准数据集上将 NPGC 与深度学习和参数化基线进行评估,证明其在多次再生循环中保持稳定性,并在显著更低的计算成本下实现竞争的下游性能。我们进一步通过在真实世界在线学习平台上的部署,验证了 NPGC 在隐私保护研究中的实际可行性。
引用
@article{arxiv.2604.04195,
title = {Stable and Privacy-Preserving Synthetic Educational Data with Empirical Marginals: A Copula-Based Approach},
author = {Gabriel Diaz Ramos and Lorenzo Luzi and Debshila Basu Mallick and Richard Baraniuk},
journal= {arXiv preprint arXiv:2604.04195},
year = {2026}
}
备注
10 pages, 6 figures. Accepted at the Educational Data Mining (EDM) 2026 conference