基于强化学习的黑盒模型反演攻击
机器学习
2023-04-11 v1 密码学与安全
计算机视觉与模式识别
摘要
模型反演攻击是一类仅通过访问机器学习模型来重建其训练所用私有数据的隐私攻击。近来,利用生成对抗网络 (GAN) 从公开数据集中提炼知识的白盒模型反演攻击因优异的攻击性能而备受关注。另一方面,当前使用 GAN 的黑盒模型反演攻击存在诸如无法保证在预定查询次数内完成攻击过程、或达到与白盒攻击同等性能等问题。为克服这些局限,我们提出一种基于强化学习的黑盒模型反演攻击。我们将潜空间搜索建模为马尔可夫决策过程 (MDP) 问题并以强化学习求解。我们的方法利用生成图像的置信度分数为智能体提供奖励。最终,可使用在 MDP 中训练所得的智能体所发现的潜向量重建私有数据。在多个数据集与模型上的实验结果表明,我们的攻击通过取得最先进的攻击性能成功恢复了目标模型的私有信息。我们通过提出一种更先进的黑盒模型反演攻击,强调隐私保护机器学习研究的重要性。
引用
@article{arxiv.2304.04625,
title = {Reinforcement Learning-Based Black-Box Model Inversion Attacks},
author = {Gyojin Han and Jaehyun Choi and Haeil Lee and Junmo Kim},
journal= {arXiv preprint arXiv:2304.04625},
year = {2023}
}
备注
CVPR 2023, Accepted