中文

风险情境:基准测试中合成表格数据生成的隐私泄露

机器学习 2025-07-24 v1 机器学习

摘要

合成表格数据对机器学习工作流程至为重要,尤其是用于扩充小型或不平衡数据集,以及实现隐私保护的数据共享。然而,最先进的生成模型(GAN、VAE、扩散模型)依赖具有数千个样本的大规模数据集。在数据有限的场景下——即合成数据最主要的动机——这些模型容易过拟合、泄露敏感记录,且需要频繁重新训练。最近的研究利用大型预训练变换器通过基于情境学习(ICL)生成行数据,只需少量种子示例且无需参数更新,避免了重新训练。然而,ICL 会逐字重复种子行,引入一种仅在文本领域被研究过的新型隐私风险。在表格合成中——单一行数据可能识别出某个人——这种风险的严重程度尚不明确。我们通过在35个来自健康、金融和政策领域的真实表格上,对比三种基础模型(GPT-4o-mini、LLaMA 3.3 70B、TabPFN v2)与四个基线方法,构建了首个基准测试。我们评估统计保真度、下游效用和成员推断泄露。结果表明,基础模型始终表现出最高的隐私风险。LLaMA 3.3 70B 在假阳性率为1% 时的真阳性率最高可比最安全的基线高出54个百分点。GPT-4o-mini 和 TabPFN 也高度脆弱。我们绘制了隐私-效用前沿,表明CTGAN 和 GPT-4o-mini 在权衡效果方面更佳。阶梯实验发现,三个零成本提示技巧(小批量大小、低温度、使用摘要统计量)可将最坏情况下的AUC降低14个百分点,稀有类别泄露降低最高可达39个百分点,同时保持超过90%的保真度。我们的基准测试为使用基础模型进行更安全的数据有限合成提供了实用指南。

关键词

引用

@article{arxiv.2507.17066,
  title  = {Risk In Context: Benchmarking Privacy Leakage of Foundation Models in Synthetic Tabular Data Generation},
  author = {Jessup Byun and Xiaofeng Lin and Joshua Ward and Guang Cheng},
  journal= {arXiv preprint arXiv:2507.17066},
  year   = {2025}
}

备注

Accepted by Agentic & GenAI Evaluation KDD2025, poster presentation