ReMIA:针对合成数据生成器的成员推理攻击的一种强大且高效的替代方法
机器学习
2026-05-15 v1
摘要
在隐私约束下的表格数据共享对研究与协作日益重要。合成数据生成器 (SDGs) 是一种有前景的解决方案,但合成数据仍易受攻击,例如旨在确定特定记录是否属于训练数据的成员推理攻击。最先进的 MIAs 虽强大但不切实际:它们依赖影子建模,需要数百次 SDG 训练运行,且需要比原训练集大数倍的辅助数据。诸如到最近记录距离 (DCR) 之类的快速代理度量虽高效,但对 MIA 风险的敏感度有限。我们引入了 ReMIA(相对成员推理攻击),这是一种实用的隐私度量,仅需两次 SDG 训练运行且额外数据不大于原训练集。ReMIA 并非预测某条记录是否在训练集中,而是从两个源数据集生成两个合成数据集,并度量分类器能否识别记录所属的源。跨多个表格数据集与 SDGs 的实验表明,ReMIA 的敏感度与最先进的 MIAs 相当,同时实用性大幅提升。我们进一步观察到,SDGs 能够实现传统基于噪声的匿名化方法无法匹敌的隐私-效用权衡。代码可在 https://github.com/aindo-com/remia 获取。
引用
@article{arxiv.2605.14686,
title = {ReMIA: a Powerful and Efficient Alternative to Membership Inference Attacks against Synthetic Data Generators},
author = {Davide Scassola and Andrea Coser and Sebastiano Saccani},
journal= {arXiv preprint arXiv:2605.14686},
year = {2026}
}