中文

BadPrompt:面向连续提示的后门攻击

计算与语言 2022-11-29 v1 人工智能

摘要

基于提示的学习范式近来获得大量研究关注。它已在若干 NLP 任务上取得最先进性能,尤其在少样本场景中。在引导下游任务的同时,鲜有工作报道探究基于提示模型的安全问题。本文中,我们首次研究连续提示学习算法对后门攻击的脆弱性。我们观察到少样本场景对基于提示模型的后门攻击提出了巨大挑战,限制了现有 NLP 后门方法的可用性。为应对该挑战,我们提出 BadPrompt,一种轻量且任务自适应的算法,对连续提示进行后门攻击。具体而言,BadPrompt 首先生成对预测目标标签具有指示性且与非目标标签样本相异的候选触发器。随后,它通过自适应触发器优化算法为每个样本自动选择最有效且不可见的触发器。我们在五个数据集与两个连续提示模型上评估 BadPrompt 的性能。结果展示了 BadPrompt 在保持干净测试集高性能的同时有效攻击连续提示的能力,大幅优于基线模型。BadPrompt 的源代码公开于 https://github.com/papersPapers/BadPrompt。

关键词

引用

@article{arxiv.2211.14719,
  title  = {BadPrompt: Backdoor Attacks on Continuous Prompts},
  author = {Xiangrui Cai and Haidong Xu and Sihan Xu and Ying Zhang and Xiaojie Yuan},
  journal= {arXiv preprint arXiv:2211.14719},
  year   = {2022}
}

备注

Accepted at NeurIPS 2022