教育中的合成数据: 传统重抽样与深度生成模型的实证洞见
机器学习
2026-04-24 v1 人工智能
摘要
合成数据生成在教育技术中旨 at 解决数据稀缺和隐私问题,然而实践者缺乏在传统重抽样技术与现代深度学习方法之间选择的实证指导。本研究使用 10,000 条学生绩效数据集,对这些范式进行首次系统性基准测试。我们评估了三种重抽样方法 (SMOTE、Bootstrap、Random Oversampling) 与三种深度学习模型 (Autoencoder、变分自编码器、Copula-GAN),从多个维度进行评估: 分布保真度 (Kolmogorov-Smirnov 距离、Jensen-Shannon 发散)、机器学习实用性如 Train-on-Synthetic-Test-on-Real 分数 (TSTR),以及隐私保护 (最近距离)。我们的发现揭示了一种根本性权衡: 重抽样方法实现近乎完美的实用性 (TSTR: 0.997),但完全无法实现隐私保护 (DCR ~ 0.00),而深度学习模型在隐私保障方面表现出色 (DCR ~ 1.00),但实用性显著下降。变分自编码器 (VAE) 成为最佳折中方案,在保持 83.3% 预测性能的同时确保了完整的隐私保护。我们还提供了可操作的建议: 在隐私受控的内部开发中使用传统重抽样方法,在隐私至关重要的外部数据共享中使用 VAE。本工作建立了学习分析中合成数据生成的基础性基准和实用决策框架。
引用
@article{arxiv.2604.21031,
title = {Synthetic Data in Education: Empirical Insights from Traditional Resampling and Deep Generative Models},
author = {Tapiwa Amion Chinodakufa and Ashfaq Ali Shafin and Khandaker Mamun Ahmed},
journal= {arXiv preprint arXiv:2604.21031},
year = {2026}
}