基于边界排斥的仅标签模型反演攻击
机器学习
2022-03-04 v1 计算机视觉与模式识别
摘要
近期研究表明,最先进的深度神经网络易受模型反演攻击,其中对模型的访问被滥用以重建任意给定目标类的私有训练数据。现有攻击依赖于能够访问完整目标模型(白盒)或模型的软标签(黑盒)。然而,在更难但更实际的场景下,即攻击者仅能访问模型预测的标签而无置信度度量,此前尚无相关工作。在本文中,我们引入一种算法——边界排斥模型反演(BREP-MI),以仅使用目标模型预测的标签来反演私有训练数据。我们算法的核心思想是在一个球面上评估模型的预测标签,然后估计到达目标类质心的方向。以人脸识别为例,我们表明由 BREP-MI 重建的图像成功复现了多种数据集与目标模型架构下私有训练数据的语义。我们将 BREP-MI 与最先进的白盒与黑盒模型反演攻击进行比较,结果表明尽管对目标模型的假设知识更少,BREP-MI 优于黑盒攻击并取得了与白盒攻击相当的结果。
引用
@article{arxiv.2203.01925,
title = {Label-Only Model Inversion Attacks via Boundary Repulsion},
author = {Mostafa Kahla and Si Chen and Hoang Anh Just and Ruoxi Jia},
journal= {arXiv preprint arXiv:2203.01925},
year = {2022}
}
备注
Accepted at CVPR2022