LMSanitator:防御针对任务无关后门的提示微调
计算与语言
2023-10-17 v2 密码学与安全
机器学习
摘要
提示微调(prompt-tuning)因其强劲的下游任务性能与高效的多任务服务能力,已成为部署大规模语言模型的一种引人注目的范式。尽管被广泛采用,我们经实证表明提示微调易受下游任务无关后门攻击,此类后门驻留于预训练模型中,可影响任意下游任务。最先进的后门检测方法无法防御任务无关后门,因为它们在反转后门触发器时难以收敛。为解决该问题,我们提出LMSanitator,一种用于检测并移除Transformer模型上任务无关后门的新方法。LMSanitator不直接反转触发器,而是旨在反转任务无关后门的预定义攻击向量(即输入嵌入触发器时预训练模型的输出),从而取得远优的收敛性能与后门检测准确率。LMSanitator进一步利用提示微调冻结预训练模型的特性,在推理阶段执行准确且快速的输出监控与输入净化。在多个语言模型与NLP任务上的大量实验说明了LMSanitator的有效性。例如,LMSanitator在960个模型上取得92.8%的后门检测准确率,并在多数场景下将攻击成功率降至低于1%。
引用
@article{arxiv.2308.13904,
title = {LMSanitator: Defending Prompt-Tuning Against Task-Agnostic Backdoors},
author = {Chengkun Wei and Wenlong Meng and Zhikun Zhang and Min Chen and Minghu Zhao and Wenjing Fang and Lei Wang and Zihui Zhang and Wenzhi Chen},
journal= {arXiv preprint arXiv:2308.13904},
year = {2023}
}
备注
To Appear in the Network and Distributed System Security (NDSS) Symposium 2024, 26 February - 1 March 2024, San Diego, CA, USA; typos corrected