中文

模型抽取与对抗可迁移性:你的BERT并不安全!

计算与语言 2021-03-19 v1

摘要

从文本分类到文本生成的自然语言处理(NLP)任务,已被BERT等预训练语言模型所革新。这使得企业能够通过封装用于下游任务的微调BERT模型轻松构建强大的API。然而,当微调BERT模型作为服务部署时,可能遭受恶意用户发起的各类攻击。本工作中,我们首先展示攻击者在仅有有限先验知识与查询次数下,如何于多个基准数据集上窃取基于BERT的API服务(受害/目标模型)。我们进一步表明,所抽取模型可对受害模型引发高度可迁移的对抗攻击。我们的研究表明,即便受害模型与攻击模型间存在架构不匹配,基于BERT的API服务的潜在漏洞依然成立。最后,我们考察了两种保护受害模型的防御策略,发现除非牺牲受害模型性能,否则模型抽取与对抗可迁移性均可有效攻破目标模型。

关键词

引用

@article{arxiv.2103.10013,
  title  = {Model Extraction and Adversarial Transferability, Your BERT is Vulnerable!},
  author = {Xuanli He and Lingjuan Lyu and Qiongkai Xu and Lichao Sun},
  journal= {arXiv preprint arXiv:2103.10013},
  year   = {2021}
}

备注

accepted to NAACL2021