面向语言理解模型的查询预算下目标模型无关的对抗攻击
机器学习
2021-06-17 v1 密码学与安全
摘要
尽管随着 BERT 和 XLNet 等模型的出现,自然语言理解模型取得了显著改进,这些基于神经网络的分类器仍易受黑盒对抗攻击,即攻击者仅被允许查询目标模型输出。我们对攻击方法增加了两项更实际的限制,即限制允许的查询次数(查询预算)以及构造可轻易跨不同预训练模型迁移的攻击(可迁移性),这使得先前的攻击模型不切实际且无效。在此,我们提出一种目标模型无关的对抗攻击方法,对所攻击模型具有高度攻击可迁移性。我们的实证研究表明,与基线方法相比,在有限查询预算限制下,我们的方法生成了高度可迁移的对抗句子。
引用
@article{arxiv.2106.07047,
title = {Target Model Agnostic Adversarial Attacks with Query Budgets on Language Understanding Models},
author = {Jatin Chauhan and Karan Bhukar and Manohar Kaul},
journal= {arXiv preprint arXiv:2106.07047},
year = {2021}
}