通过上下文学习打破表格数据生成中的质量与隐私权衡
机器学习
2026-05-07 v1
摘要
表格数据合成旨在生成高质量数据的同时保护隐私。然而,我们发现现有的表格生成模型在小数据场景下表现出明显的权衡:提高数据质量通常以增加训练样本的记忆为代价,从而削弱了隐私保护。这种权衡的出现是因为小训练集使得特定数据集的生成模型难以区分可泛化的结构与样本特定的模式。为了解决这个问题,我们提出了 DiffICL,它将表格数据生成表述为一个上下文学习问题。DiffICL 不从零开始拟合每个数据集,而是利用从大量数据集中学习到的预训练结构先验,使其能够从有限的上下文中推断数据分布,而不是记忆单个样本。我们在 14 个真实世界数据集上评估了 DiffICL。结果表明,DiffICL 同时提高了数据质量和隐私性,并生成了提供有效数据增强的合成数据。我们的发现表明,可以通过更好的训练范式来改善质量与隐私的权衡。
引用
@article{arxiv.2605.04911,
title = {Breaking the Quality-Privacy Tradeoff in Tabular Data Generation via In-Context Learning},
author = {Xinyan Han and Yan Lu and Xiaoyu Lin and Yuanyuan Jiang and Yuanrui Wang and Xuanyue Li and Wenchao Zou and Xingxuan Zhang},
journal= {arXiv preprint arXiv:2605.04911},
year = {2026}
}