在保护隐私的同时扩展规模:学习分析中合成表格数据的全面生成与评估
密码学与安全
2024-01-17 v1 人工智能
摘要
隐私对学习分析 (LA) 的进展构成重大障碍,带来了匿名化不充分和数据滥用等当前解决方案难以应对的挑战。合成数据作为一种潜在的补救措施出现,提供了强大的隐私保护。然而,先前 LA 领域对合成数据的研究缺乏全面评估,而评估对于权衡隐私与数据效用之间的微妙平衡至关重要。合成数据不仅必须增强隐私,还需保持对数据分析的实用性。此外,多样的 LA 场景伴随着不同的隐私和效用需求,使得选择合适的合成数据方法成为一项紧迫挑战。为解决这些不足,我们提出了一个全面的合成数据评估框架,涵盖合成数据质量的三个维度,即相似性、效用和隐私。我们将此评估应用于三个不同的 LA 数据集,使用三种不同的合成数据生成方法。结果表明,合成数据在保护隐私的同时,可以保持与真实数据相似的效用(即预测性能)。此外,考虑到不同 LA 场景中不同的隐私和数据效用需求,我们为合成数据生成提供了定制化建议。本文不仅呈现了对合成数据的全面评估,还阐明了其在缓解 LA 领域隐私担忧方面的潜力,从而有助于合成数据在 LA 中的更广泛应用,并促进更好的开放科学实践。
引用
@article{arxiv.2401.06883,
title = {Scaling While Privacy Preserving: A Comprehensive Synthetic Tabular Data Generation and Evaluation in Learning Analytics},
author = {Qinyi Liu and Mohammad Khalil and Ronas Shakya and Jelena Jovanovic},
journal= {arXiv preprint arXiv:2401.06883},
year = {2024}
}