一幅图胜千言:通过科学图表实施的模型信息窃取攻击
密码学与安全
2023-02-24 v1 机器学习
摘要
构建先进的机器学习(ML)模型需要专业知识和大量试验以发现最佳架构和超参数设置。先前的研究表明,模型信息可被用于辅助其他攻击,例如成员推断、生成对抗样本。因此,此类信息(如超参数)应予以保密。众所周知, adversary 可利用目标 ML 模型的输出来窃取模型信息。在本文中,我们发现了一种用于模型信息窃取攻击的新侧信道,即模型的科学图表——其被广泛用于展示模型性能且易于获取。我们的攻击简单直接。我们利用影子模型训练技术为攻击模型(本质上是一个图像分类器)生成训练数据。在三个基准数据集上的大量评估表明,给定由基于卷积神经网络(CNN)的图像分类器生成的科学图表,我们提出的攻击能有效推断其架构/超参数。我们还揭示攻击的成功主要源于科学图表的形状,并进一步证明攻击在各种场景下具有鲁棒性。鉴于该攻击方法的简单性与有效性,我们的研究表明科学图表确实构成了模型信息窃取攻击的有效侧信道。为缓解攻击,我们提出了若干防御机制,可在保持图表效用的同时降低原始攻击的准确率。然而,此类防御仍可被自适应攻击绕过。
引用
@article{arxiv.2302.11982,
title = {A Plot is Worth a Thousand Words: Model Information Stealing Attacks via Scientific Plots},
author = {Boyang Zhang and Xinlei He and Yun Shen and Tianhao Wang and Yang Zhang},
journal= {arXiv preprint arXiv:2302.11982},
year = {2023}
}
备注
To appear in the 32nd USENIX Security Symposium, August 2023, Anaheim, CA, USA