中文

面向硬标签场景的数据免费模型窃取:查询高效数据生成探索

密码学与安全 2024-12-23 v1 人工智能 计算与语言

摘要

数据免费模型窃取涉及在不获取目标模型结构、参数或训练数据的情况下,将目标模型的功能复制到替代模型中。对手只能访问目标模型对生成样本的预测。一旦替代模型紧密逼近目标模型的行为,攻击者即可利用其白盒特性进行后续恶意活动,如对抗攻击。现有方法在协作博弈框架下往往产生对替代模型高度自信的样本,这会使替代模型难以复制目标模型的行为。本文提出一种新型数据免费模型窃取方法,称为查询高效数据生成(Query Efficient Data Generation, QEDG)。我们引入两种不同的损失函数,以确保生成的样本在多个类别上与目标模型的决策边界紧密且均匀地对齐。基于当前方法通常仅每一次查询获得一项监督信息的局限,我们提出查询免费样本增强,使获取额外监督信息时无需增加查询次数。鼓励我们的理论分析,我们采用一致性率指标,这一指标更准确地评估替代模型与目标模型的相似性。我们在真实的 MLaaS 场景下对五个数据集进行了大量实验,验证了我们方法的有效性,该方法在查询次数方面优于当前最先进方法。

关键词

引用

@article{arxiv.2412.15275,
  title  = {Fooling LLM graders into giving better grades through neural activity guided adversarial prompting},
  author = {Atsushi Yamamura and Surya Ganguli},
  journal= {arXiv preprint arXiv:2412.15275},
  year   = {2024}
}

备注

16 pages, 11 figures