经验总结:防御属性推断攻击
密码学与安全
2023-10-10 v4 人工智能
机器学习
摘要
本工作调查并评估了多种针对属性推断攻击 (PIA) 的防御策略,PIA 是一种针对机器学习模型的隐私攻击。给定一个训练好的机器学习模型,PIA 旨在提取其底层训练数据的统计属性,例如揭示医疗训练数据集中男女的比例。尽管针对成员推断等其他隐私攻击已发表大量防御机制研究,但本文是首个聚焦于防御 PIA 的工作。以开发针对白盒 PIA 的通用缓解策略为主要目标,我们提出新颖方法“属性遗忘”(property unlearning)。关于属性遗忘的大量实验表明,尽管它在防御目标模型抵御特定敌手时非常有效,但属性遗忘无法泛化,即无法保护模型抵御整类 PIA。为探究该局限背后的原因,我们展示了使用可解释 AI 工具 LIME 的实验结果,其表明具有同一目标的最先进属性推断敌手会聚焦于目标模型的不同部分。我们通过后续实验进一步阐述这一点:使用可视化技术 t-SNE 展示统计训练数据属性在机器学习模型中的显现程度之深。基于此,我们提出猜想:像属性遗忘这样的训练后技术可能不足以提供针对 PIA 所需的通用保护。作为替代,我们研究了更简单的训练数据预处理方法(如向训练数据集的图像添加高斯噪声)对 PIA 成功率的影响。我们以对不同防御方法的讨论作结,总结所得经验,并给出未来工作方向。
引用
@article{arxiv.2205.08821,
title = {Lessons Learned: Defending Against Property Inference Attacks},
author = {Joshua Stock and Jens Wettlaufer and Daniel Demmler and Hannes Federrath},
journal= {arXiv preprint arXiv:2205.08821},
year = {2023}
}