SCME:一种无数据且查询受限的自对比模型提取攻击方法
计算机视觉与模式识别
2023-10-17 v1
摘要
既往研究表明人工智能(AI)系统易受对抗攻击。其中,模型提取攻击通过在替代模型上生成对抗样本来欺骗目标模型。此类攻击的核心在于训练一个尽可能近似目标模型的替代模型,其模拟过程可分为依赖数据与无数据两类方式。相较依赖数据方法,无数据方法已被证实在现实世界中更实用,因其以合成数据训练替代模型。然而,这些伪数据的分布缺乏多样性,不能很好探测目标模型的决策边界,导致模拟效果欠佳。此外,这些无数据技术需海量查询以训练替代模型,增加了时间与计算消耗及暴露风险。为解决上述问题,本文提出一种名为 SCME(Self-Contrastive Model Extraction,自对比模型提取)的新型无数据模型提取方法,其在合成伪数据时兼顾类间与类内多样性。另外,SCME 引入 Mixup 操作增广伪数据,可有效探索目标模型决策边界并提升模拟能力。大量实验表明所提方法能产出多样化伪数据。而且,我们的方法在查询受限场景下的多种攻击设置中均展现优势,尤其对于无目标攻击,SCME 在五个基线数据集上平均超越 SOTA 方法 11.43%。
引用
@article{arxiv.2310.09792,
title = {SCME: A Self-Contrastive Method for Data-free and Query-Limited Model Extraction Attack},
author = {Renyang Liu and Jinhong Zhang and Kwok-Yan Lam and Jun Zhao and Wei Zhou},
journal= {arXiv preprint arXiv:2310.09792},
year = {2023}
}