中文

MeaeQ:以高效查询发起模型提取攻击

计算与语言 2023-10-24 v1

摘要

我们研究自然语言处理(NLP)中的模型提取攻击,其中攻击者旨在通过反复查询开放的应用程序编程接口(API)来窃取受害模型。近期工作聚焦于有限查询预算设定,并采用在公开可用、未标注数据源上的随机采样或基于主动学习的采样策略。然而,这些方法所选查询往往缺乏任务相关性与数据多样性,导致在以低查询成本取得满意结果方面收效有限。本文中,我们提出 MeaeQ(以高效查询进行模型提取攻击),一种直截了当却有效的方法来解决这些问题。具体而言,我们首先利用零样本序列推断分类器,结合 API 服务信息,从公共文本语料库而非问题领域特定数据集中筛选任务相关数据。此外,我们采用基于聚类的数据约简技术,获得具有代表性的数据作为攻击查询。在四个基准数据集上的大量实验表明,MeaeQ 在与受害模型的功能相似性上高于基线方法,同时所需查询更少。我们的代码见 https://github.com/C-W-D/MeaeQ。

关键词

引用

@article{arxiv.2310.14047,
  title  = {MeaeQ: Mount Model Extraction Attacks with Efficient Queries},
  author = {Chengwei Dai and Minxuan Lv and Kun Li and Wei Zhou},
  journal= {arXiv preprint arXiv:2310.14047},
  year   = {2023}
}

备注

Accepted by EMNLP 2023 main conference