中文

TARGET:基于GPT4的面向提示式NLP模型的可模板迁移后门攻击

计算与语言 2023-11-30 v1 人工智能

摘要

基于提示的学习已广泛应用于少样本等许多低资源NLP任务中。然而,该范式已被证明易受后门攻击。现有多数攻击方法侧重于在预训练阶段插入人工预定义模板作为触发器来训练受害模型,并在下游任务中使用相同触发器进行推理,往往忽略了模板的可迁移性与隐蔽性。本工作中,我们提出一种新颖的TARGET方法(Template-trAnsfeRable backdoor attack aGainst prompt-basEd NLP models via GPT4),这是一种数据无关的攻击方法。具体而言,我们首先利用GPT4对人工模板进行改写,生成语气强烈与正常两类模板,并将前者作为后门触发器注入预训练阶段的模型中。随后,我们不仅在下游任务中直接使用上述模板,还利用GPT4生成与上述模板语气相似的模板以实施可迁移攻击。最后我们在五个NLP数据集与三个BERT系列模型上进行了充分实验,结果表明相较两种外部基线方法,我们的TARGET方法在直接攻击上具有更优的攻击性能与隐蔽性,并且在未见过的语气相似模板上也取得了令人满意的攻击能力。

关键词

引用

@article{arxiv.2311.17429,
  title  = {TARGET: Template-Transferable Backdoor Attack Against Prompt-based NLP Models via GPT4},
  author = {Zihao Tan and Qingliang Chen and Yongjian Huang and Chen Liang},
  journal= {arXiv preprint arXiv:2311.17429},
  year   = {2023}
}