利用对抗样本增强模型反演攻击
密码学与安全
2023-06-27 v1 人工智能
摘要
模型反演攻击涉及重构目标模型的训练数据,这引发了机器学习模型的严重隐私担忧。然而,这些攻击尤其是基于学习的方法,往往面临攻击准确率低下的问题,即这些重构数据被机器学习分类器分类的准确率较低。近期研究表明,一种替代策略——基于GAN的优化——能有效提升攻击准确率。但这类基于GAN的攻击仅能重构某一类的类代表性训练数据,而基于学习的方法可为每类中不同训练数据重构多样化数据。因此,本文提出一种用于基于学习的模型反演攻击的新训练范式,可在黑盒设定下实现更高攻击准确率。首先,我们通过引入额外的语义损失函数正则化攻击模型的训练过程;其次,我们将对抗样本注入训练数据,以增加训练数据中类相关部分(即分类任务的本质特征)的多样性。该方案引导攻击模型在数据重构过程中更多关注原始数据的类相关部分。实验结果表明,我们的方法大幅提升了现有基于学习的模型反演攻击性能。即便不允许对目标模型进行额外查询,该方法仍可提高重构数据的攻击准确率。这一新攻击表明,基于学习的模型反演敌手所构成威胁的严重性被低估,需要更鲁棒的保护措施。
引用
@article{arxiv.2306.13965,
title = {Boosting Model Inversion Attacks with Adversarial Examples},
author = {Shuai Zhou and Tianqing Zhu and Dayong Ye and Xin Yu and Wanlei Zhou},
journal= {arXiv preprint arXiv:2306.13965},
year = {2023}
}
备注
18 pages, 13 figures