仅标签模型反演攻击:所需信息最少的攻击
密码学与安全
2022-03-15 v1 人工智能
摘要
在模型反演攻击中, adversary(敌手)试图仅利用目标模型的输出重建用于训练该模型的数据记录。在发起当代模型反演攻击时,所讨论的策略通常基于预测的置信度分数向量(即黑盒攻击)或目标模型的参数(即白盒攻击)。然而在现实世界中,模型拥有者通常只给出预测的标签;置信度分数向量和模型参数被隐藏起来,作为一种防御机制以防止此类攻击。不幸的是,我们发现了一种仅基于输出标签即可重建输入数据记录的模型反演方法。我们认为这是成功所需信息最少、因而适用性最好的攻击。其核心思想是利用目标模型的错误率来计算一组数据记录到目标模型决策边界的中位距离。随后,该距离被用于生成置信度分数向量,并采用这些向量训练一个攻击模型以重建数据记录。实验结果表明,与现有方法相比,可用远少的信息重建出高度可辨识的数据记录。
引用
@article{arxiv.2203.06555,
title = {Label-only Model Inversion Attack: The Attack that Requires the Least Information},
author = {Dayong Ye and Tianqing Zhu and Shuai Zhou and Bo Liu and Wanlei Zhou},
journal= {arXiv preprint arXiv:2203.06555},
year = {2022}
}