中文

一石二鸟:针对基于 BERT 的 API 的模型提取与属性推断攻击

密码学与安全 2021-12-28 v2 计算与语言 机器学习

摘要

大数据的收集与可用,结合预训练模型(如 BERT、XLNET 等)的进展,革新了从文本分类到文本生成的现代自然语言处理任务的预测性能。这使得企业能够将微调后的基于 BERT 的模型封装为 API,从而提供机器学习即服务(MLaaS)。然而,基于 BERT 的 API 已暴露出一系列安全与隐私漏洞。例如,已有工作通过提取模型构造对抗样本,利用了基于 BERT 的 API 的安全问题。但是,通过提取模型导致的基于 BERT 的 API 的隐私泄露问题尚未得到充分研究。另一方面,由于基于 BERT 的 API 的高容量,微调模型易于过学习,但从提取模型中可能泄露何种信息仍属未知。在这项工作中,我们填补了这一空白:首先提出一种有效的模型提取攻击, adversary 仅通过查询有限次即可实际窃取基于 BERT 的 API(目标/受害模型)。我们进一步开发了一种有效的属性推断攻击,可推断基于 BERT 的 API 所用训练数据的敏感属性。我们在多种现实设置下的基准数据集上的大量实验验证了基于 BERT 的 API 的潜在漏洞。此外,我们证明两种有前景的防御方法对我们的攻击无效,这需要更有效的防御方法。

关键词

引用

@article{arxiv.2105.10909,
  title  = {Killing One Bird with Two Stones: Model Extraction and Attribute Inference Attacks against BERT-based APIs},
  author = {Chen Chen and Xuanli He and Lingjuan Lyu and Fangzhao Wu},
  journal= {arXiv preprint arXiv:2105.10909},
  year   = {2021}
}