基于加权多PLM融合的对比式隐私数据合成
机器学习
2025-02-04 v1
摘要
充足的数量和高质量是构建良好训练数据集的黄金法则,同时样本隐私保护同样重要。生成既类似于高质量私有数据又确保差分隐私(Differential Privacy, DP)这一正式隐私保障的合成样本,有望实现可扩展性和实用性。然而,现有依赖预训练模型进行数据合成的方法,在数据匮乏的场景下往往表现不佳,受到样本量有限、不可避免的生成噪声以及现有预训练模型偏差的困扰。为了解决这些挑战,我们提出了一种新颖的基于加权多预训练语言模型(Pre-trained Language Model, PLM)的对比私有数据合成框架,命名为WASP。WASP利用有限的私有样本,通过Top-Q投票机制更准确地估计私有数据分布,并利用低质量合成样本,通过动态加权的多个预训练模型之间的协作进行对比生成。在6个成熟数据集上使用6个开源和3个闭源PLM进行的大量实验表明,WASP在提升多种下游任务的模型性能方面具有优越性。代码可在https://anonymous.4open.science/r/WASP获取。
引用
@article{arxiv.2502.00245,
title = {Contrastive Private Data Synthesis via Weighted Multi-PLM Fusion},
author = {Tianyuan Zou and Yang Liu and Peng Li and Yufei Xiong and Jianqing Zhang and Jingjing Liu and Xiaozhou Ye and Ye Ouyang and Ya-Qin Zhang},
journal= {arXiv preprint arXiv:2502.00245},
year = {2025}
}
备注
16 pages, 11 tables, 7 figures