PPO-MI:基于近端策略优化的高效黑盒模型反演
机器学习
2025-02-21 v1 计算机视觉与模式识别
摘要
模型反演攻击通过尝试从训练好的模型重建私有训练数据来构成重大的隐私风险。大多数现有方法要么依赖梯度估计,要么需要对模型参数的白盒访问,这限制了其在实际场景中的适用性。在本文中,我们提出PPO-MI,这是一个基于强化学习的新型黑盒模型反演框架。我们将反演任务形式化为马尔可夫决策过程,其中一个代理人通过仅使用模型预测,在生成模型的潜在空间中导航来重建私有训练样本。通过采用带有动量-based状态转换机制的近端策略优化(PPO),并设计一种平衡预测准确性和探索的奖励函数,PPO-MI确保了潜在空间的高效探索和高查询效率。我们进行了大量实验,表明PPO-MI在需要更少攻击知识的情况下优于现有方法,并且在 various model architectures and datasets 之间具有鲁棒性。这些结果凸显了其在实际黑盒场景中的有效性和通用性,提升了对部署机器学习模型隐私漏洞的重要性考量。
引用
@article{arxiv.2502.14370,
title = {PPO-MI: Efficient Black-Box Model Inversion via Proximal Policy Optimization},
author = {Xinpeng Shou},
journal= {arXiv preprint arXiv:2502.14370},
year = {2025}
}
备注
6 pages, submitting to ICML 2025