利用 Rényi 差分隐私防御重构攻击
机器学习
2022-02-16 v1 人工智能
密码学与安全
机器学习
摘要
重构攻击允许 adversary 仅通过访问训练好的模型就重新生成训练集中的数据样本。最近的研究表明,简单启发式方法即可从语言模型中重构数据样本,使得该威胁场景成为模型发布的重要考量。差分隐私是此类攻击的已知解决方案,但常配合较大的隐私预算(epsilon > 8)使用,而这并不能转化为有意义的保证。在本文中我们表明,对于同一机制,我们可以推导出比文献中传统保证更好的针对重构攻击的隐私保证。特别地,我们表明较大的隐私预算不能防御成员推断,但仍可保护稀有秘密的提取。我们通过实验证明,我们的保证对各类语言模型均成立,包括基于 Wikitext-103 微调的 GPT-2。
引用
@article{arxiv.2202.07623,
title = {Defending against Reconstruction Attacks with R\'enyi Differential Privacy},
author = {Pierre Stock and Igor Shilov and Ilya Mironov and Alexandre Sablayrolles},
journal= {arXiv preprint arXiv:2202.07623},
year = {2022}
}