NOTABLE:面向基于提示的NLP模型的可迁移后门攻击
计算与语言
2023-05-30 v1 密码学与安全
摘要
基于提示的学习易受后门攻击。现有针对基于提示的模型的后门攻击考虑将后门注入整个嵌入层或词嵌入向量中。此类攻击易受到下游任务重训练及不同提示策略的影响,限制了后门攻击的可迁移性。本文提出针对基于提示的模型的可迁移后门攻击NOTABLE,其独立于下游任务与提示策略。具体而言,NOTABLE利用自适应 verbalizer 将触发器绑定到特定词(即锚点),从而将后门注入预训练语言模型(PLM)的编码器中。它通过粘贴带触发器的输入以到达攻击者期望的锚点来激活后门,实现了对下游任务和提示策略的独立性。我们在六个NLP任务、三个流行模型和三种提示策略上进行了实验。实证结果表明,NOTABLE取得了优越的攻击性能(即在所有数据集上攻击成功率超过90%),并优于两个最先进的基线。对三种防御的评估显示了NOTABLE的鲁棒性。我们的代码见 https://github.com/RU-System-Software-and-Security/Notable。
引用
@article{arxiv.2305.17826,
title = {NOTABLE: Transferable Backdoor Attacks Against Prompt-based NLP Models},
author = {Kai Mei and Zheng Li and Zhenting Wang and Yang Zhang and Shiqing Ma},
journal= {arXiv preprint arXiv:2305.17826},
year = {2023}
}