Purifier:通过变换置信度分数防御数据推断攻击
机器学习
2022-12-02 v1 密码学与安全
摘要
神经网络易受数据推断攻击,如成员推断攻击、对抗模型反演攻击和属性推断攻击,攻击者可根据目标分类器预测的置信度分数推断数据样本的成员关系、重建结果或敏感属性等有用信息。本文提出一种名为 PURIFIER 的方法来防御成员推断攻击。它变换目标分类器预测的置信度分数向量,使净化后的置信度分数在个体形状、统计分布和预测标签上在成员与非成员之间不可区分。实验结果表明,PURIFIER 以高有效性和高效率帮助防御成员推断攻击,优于以往的防御方法,并且引起的效用损失可忽略不计。此外,我们的进一步实验表明,PURIFIER 在防御对抗模型反演攻击和属性推断攻击方面同样有效。例如,在 Facescrub530 分类器上反演误差提高了约 4 倍以上,并且在我们的实验中部署 PURIFIER 后属性推断准确率显著下降。
引用
@article{arxiv.2212.00612,
title = {Purifier: Defending Data Inference Attacks via Transforming Confidence Scores},
author = {Ziqi Yang and Lijin Wang and Da Yang and Jie Wan and Ziming Zhao and Ee-Chien Chang and Fan Zhang and Kui Ren},
journal= {arXiv preprint arXiv:2212.00612},
year = {2022}
}
备注
accepted by AAAI 2023