中文

风险均衡差分隐私合成数据:通过控制记录级影响来保护离群点

机器学习 2026-02-12 v1

摘要

在发布合成数据时,某些个体的保护比其他个体更困难。患有罕见疾病组合的患者或具有异常特征的交易在众多记录中脱颖而出。差分隐私提供最坏情况保证,但在中等隐私预算下并辅以外部信息时,经验性攻击——尤其是成员推断——对此类离群点成功率更高。本文引入风险均衡差分隐私合成(risk-equalized DP synthesis)框架,通过减少高风险记录对学习生成器的影响来优先保护高风险记录。该机制分为两个阶段:首先,少量隐私预算用于估计每条记录的"离群程度";其次,差分隐私学习过程按风险得分的倒数对每条记录加权。在高斯机制下,记录的隐私损失与其对输出的影响成正比——因此刻意缩小离群点的贡献可为恰好最需要保护的记录获得更紧密的实例级隐私界限。我们通过组成分证明端到端差分隐私保证,并推导出合成阶段(评分阶段添加均匀的记录级项)的闭式记录界限。对模拟数据进行实验,控制离群点注入,显示风险加权显著降低了针对高离群程度记录的成员推断成功率;消融实验确认,针对性加权而非随机加权是驱动改进的关键。在真实数据集(乳腺癌、成人、德国信用)上,效果因数据集而异,凸显了评分器质量与合成管道之间的相互作用。

关键词

引用

@article{arxiv.2602.10232,
  title  = {Risk-Equalized Differentially Private Synthetic Data: Protecting Outliers by Controlling Record-Level Influence},
  author = {Amir Asiaee and Chao Yan and Zachary B. Abrams and Bradley A. Malin},
  journal= {arXiv preprint arXiv:2602.10232},
  year   = {2026}
}