你真的需要公共数据吗?基于差分隐私的表格数据的替代公共数据
机器学习
2025-04-22 v1 密码学与安全
摘要
差分隐私机器学习通常依赖于公共数据的可用性,以完成隐私-实用性权衡估计、超参数调优和预训练等任务。虽然在文本和图像领域的公共数据假设可能合理,但由于表格数据在不同领域的异质性,公共数据的假设在表格数据领域则不太成立。我们提出利用强大的先验知识来解决这一限制;具体而言,我们从模式级别规范中直接合成逼真的表格数据,如变量名称、类型和可允许范围,而无需访问敏感记录。为此,本工作引入了“替代公共数据”的概念——这些数据是独立于敏感数据生成的数据集,不消耗隐私预算,且仅由公开可用的模式或元数据构建而成。替代公共数据旨在编码由公开信息所知情的统计假设,以便在众多下游任务中使用。我们利用大型语言模型 (LLM) 自动生成替代公共数据的过程;具体而言,我们提出两种方法:直接以 CSV 文件生成记录,以及为采样记录构建自动化结构因果模型 (SCM)。通过大量实验,我们展示了替代公共表格数据在预训练差分隐私表格分类器时可以有效地替代传统公共数据。尽管替代公共数据在差分隐私人工合成数据生成器的超参数调优以及估计隐私-实用性权衡方面作用较小,但仍具有一定价值。
引用
@article{arxiv.2504.14368,
title = {Do You Really Need Public Data? Surrogate Public Data for Differential Privacy on Tabular Data},
author = {Shlomi Hod and Lucas Rosenblatt and Julia Stoyanovich},
journal= {arXiv preprint arXiv:2504.14368},
year = {2025}
}