中文

SMOTE 与镜像:揭露合成少数类过采样中的隐私泄露

密码学与安全 2026-03-03 v3

摘要

合成少数类过采样技术(SMOTE)是最广泛使用的解决类别不平衡和生成合成数据的方法之一。尽管其流行度极高,但关于其隐私影响的研究却鲜少涉及;然而,它在众多隐私敏感应用中被广泛使用。本文首次系统性研究 SMOTE 的隐私泄露问题:我们指出现有评估方法(即朴素区分和最近距离度量)完全无法检测到任何泄露, membership 推断攻击(MIAs)可高精度实例化。随后,基于 SMOTE 的几何特性,我们构建两种新型攻击,假设极少:DistinSMOTE 能完美区分增强数据集中的真实与合成记录,ReconSMOTE 则能在真实不平衡比例下,以接近 1 的精确率和召回率从合成数据集中重建真实少数类记录。我们还为两种攻击提供了理论保证。在八个标准不平衡数据集上的实验表明,这些攻击在实用性和有效性方面均得到验证。总体而言,本文揭示 SMOTE 本质上是非私有的,且对少数类记录的暴露程度显著高于多数类记录,凸显在隐私敏感应用中重新审视其使用,以及作为现代生成模型隐私评估基准的必要性。

关键词

引用

@article{arxiv.2510.15083,
  title  = {SMOTE and Mirrors: Exposing Privacy Leakage from Synthetic Minority Oversampling},
  author = {Georgi Ganev and Reza Nazari and Rees Davison and Amir Dizche and Xinmin Wu and Ralph Abbey and Jorge Silva and Emiliano De Cristofaro},
  journal= {arXiv preprint arXiv:2510.15083},
  year   = {2026}
}

备注

Published at the 14th International Conference on Learning Representations (ICLR 2026). Please cite the ICLR version