中文

防御作为少样本学习器的预训练语言模型免受后门攻击

机器学习 2023-09-26 v1 人工智能

摘要

预训练语言模型 (PLMs) 作为少样本学习器已展现出卓越性能。然而,其在此类设置下的安全风险很大程度上未被探索。在本工作中,我们进行了一项初步研究,表明作为少样本学习器的 PLMs 对后门攻击高度脆弱,而由于少样本场景的独特挑战,现有防御手段尚不充分。为应对这些挑战,我们提出 MDP,一种新颖的轻量、可插拔且高效的面向少样本学习器 PLMs 的防御方法。具体而言,MDP 利用中毒样本与干净样本的掩码敏感性之间的差距:以有限的少样本数据作为分布锚点,它比较给定样本在不同掩码下的表示,并将具有显著变化的样本识别为中毒样本。我们分析表明,MDP 为攻击者制造了一个在攻击有效性与规避检测之间取舍的有趣困境。使用基准数据集和代表性攻击的实证评估验证了 MDP 的有效性。

关键词

引用

@article{arxiv.2309.13256,
  title  = {Defending Pre-trained Language Models as Few-shot Learners against Backdoor Attacks},
  author = {Zhaohan Xi and Tianyu Du and Changjiang Li and Ren Pang and Shouling Ji and Jinghui Chen and Fenglong Ma and Ting Wang},
  journal= {arXiv preprint arXiv:2309.13256},
  year   = {2023}
}

备注

Accepted by NeurIPS'23