MeaeQ:以高效查询发起模型提取攻击
计算与语言
2023-10-24 v1
摘要
我们研究自然语言处理(NLP)中的模型提取攻击,其中攻击者旨在通过反复查询开放的应用程序编程接口(API)来窃取受害模型。近期工作聚焦于有限查询预算设定,并采用在公开可用、未标注数据源上的随机采样或基于主动学习的采样策略。然而,这些方法所选查询往往缺乏任务相关性与数据多样性,导致在以低查询成本取得满意结果方面收效有限。本文中,我们提出 MeaeQ(以高效查询进行模型提取攻击),一种直截了当却有效的方法来解决这些问题。具体而言,我们首先利用零样本序列推断分类器,结合 API 服务信息,从公共文本语料库而非问题领域特定数据集中筛选任务相关数据。此外,我们采用基于聚类的数据约简技术,获得具有代表性的数据作为攻击查询。在四个基准数据集上的大量实验表明,MeaeQ 在与受害模型的功能相似性上高于基线方法,同时所需查询更少。我们的代码见 https://github.com/C-W-D/MeaeQ。
引用
@article{arxiv.2310.14047,
title = {MeaeQ: Mount Model Extraction Attacks with Efficient Queries},
author = {Chengwei Dai and Minxuan Lv and Kun Li and Wei Zhou},
journal= {arXiv preprint arXiv:2310.14047},
year = {2023}
}
备注
Accepted by EMNLP 2023 main conference