中文

基于模糊随机平滑的语言模型鲁棒性认证:针对后门攻击的高效防御

机器学习 2025-02-12 v1 人工智能

摘要

预训练语言模型(PLM)的广泛部署使其暴露于文本后门攻击之下,尤其是那些在预训练阶段植入的攻击。这些攻击对高可靠性应用构成重大风险,因为它们能够隐蔽地影响多个下游任务。尽管对抗此类威胁的鲁棒性认证至关重要,但现有防御方法在面对文本数据的高维、相互依赖性质以及缺乏对原始被污染预训练数据的访问时,难以实现有效的防御。为此,我们引入了模糊随机平滑(FRS)这一新方法,通过Monte Carlo树搜索主动进行模糊处理,以识别Damerau-Levenshtein空间内的脆弱文本片段,从而实现针对性且高效的文本随机化,并在模型平滑期间无需访问被污染的训练数据。我们的理论分析表明,FRS在认证鲁棒性半径方面优于现有方法。广泛的实验在各种数据集、模型配置和攻击策略下验证了FRS在防御效率、准确率和鲁棒性方面的优势。

关键词

引用

@article{arxiv.2502.06892,
  title  = {Certifying Language Model Robustness with Fuzzed Randomized Smoothing: An Efficient Defense Against Backdoor Attacks},
  author = {Bowei He and Lihao Yin and Hui-Ling Zhen and Jianping Zhang and Lanqing Hong and Mingxuan Yuan and Chen Ma},
  journal= {arXiv preprint arXiv:2502.06892},
  year   = {2025}
}

备注

Accepted by ICLR 2025