防御作为少样本学习器的预训练语言模型免受后门攻击
机器学习
2023-09-26 v1 人工智能
摘要
预训练语言模型 (PLMs) 作为少样本学习器已展现出卓越性能。然而,其在此类设置下的安全风险很大程度上未被探索。在本工作中,我们进行了一项初步研究,表明作为少样本学习器的 PLMs 对后门攻击高度脆弱,而由于少样本场景的独特挑战,现有防御手段尚不充分。为应对这些挑战,我们提出 MDP,一种新颖的轻量、可插拔且高效的面向少样本学习器 PLMs 的防御方法。具体而言,MDP 利用中毒样本与干净样本的掩码敏感性之间的差距:以有限的少样本数据作为分布锚点,它比较给定样本在不同掩码下的表示,并将具有显著变化的样本识别为中毒样本。我们分析表明,MDP 为攻击者制造了一个在攻击有效性与规避检测之间取舍的有趣困境。使用基准数据集和代表性攻击的实证评估验证了 MDP 的有效性。
引用
@article{arxiv.2309.13256,
title = {Defending Pre-trained Language Models as Few-shot Learners against Backdoor Attacks},
author = {Zhaohan Xi and Tianyu Du and Changjiang Li and Ren Pang and Shouling Ji and Jinghui Chen and Fenglong Ma and Ting Wang},
journal= {arXiv preprint arXiv:2309.13256},
year = {2023}
}
备注
Accepted by NeurIPS'23