中文

为何训练更多?基于记忆化的高效且有效的成员推断

机器学习 2023-10-13 v1 密码学与安全

摘要

成员推断攻击(MIAs)旨在识别机器学习模型私有训练集中的特定数据样本,导致严重的隐私泄露及其他复杂威胁。许多实用的黑盒MIAs需要查询数据分布(抽取私有数据的同一分布)以训练影子模型。借此,攻击者获得“含”或“不含”从该分布抽取样本的模型,并分析所考虑样本的特征。攻击者常需训练数百个以上影子模型以提取MIAs所需信号;这成为MIAs的计算开销。本文中我们提出,通过策略性选择样本,MI攻击者可在最小化影子模型数量的同时最大化攻击成功率。首先,我们的动机实验表明记忆化是解释样本对MIAs差异性脆弱性的关键属性;我们通过将MI优势与记忆化相联系的理论界将其形式化。其次,我们给出将MIAs所需影子模型数量与记忆化相连的采样复杂度界。最后,我们通过全面实验证实理论论证:利用具有高记忆化分数的样本,攻击者能(a) 无论使用何种MIA均显著提升效能,且(b) 相较最优方法将影子模型数量减少近两个数量级。

关键词

引用

@article{arxiv.2310.08015,
  title  = {Why Train More? Effective and Efficient Membership Inference via Memorization},
  author = {Jihye Choi and Shruti Tople and Varun Chandrasekaran and Somesh Jha},
  journal= {arXiv preprint arXiv:2310.08015},
  year   = {2023}
}