中文

重新审视自然语言处理中后门攻击攻击强度的评估

计算与语言 2022-02-17 v2 密码学与安全 机器学习

摘要

已有研究表明,自然语言处理(NLP)模型易受一种称为后门攻击(backdoor attack)的安全威胁,其利用“后门触发器”范式误导模型。最具威胁性的后门攻击是隐蔽后门攻击,其将触发器定义为文本风格或句法。尽管它们取得了极高的攻击成功率(ASR),我们发现导致其 ASR 的主要因素并非“后门触发器”范式。因此,当这些隐蔽后门攻击被归类为后门攻击时,其能力被高估了。为此,为评估后门攻击的真实攻击威力,我们提出了一种称为攻击成功率差值(ASRD)的新指标,用于衡量干净状态与投毒状态模型之间的 ASR 差异。此外,由于针对隐蔽后门攻击的防御手段缺失,我们提出了 Trigger Breaker,其包含两种极为简单的技巧,可有效防御隐蔽后门攻击。实验表明,我们的方法在抵御隐蔽后门攻击方面显著优于最先进的防御方法。

关键词

引用

@article{arxiv.2201.02993,
  title  = {Rethink the Evaluation for Attack Strength of Backdoor Attacks in Natural Language Processing},
  author = {Lingfeng Shen and Haiyun Jiang and Lemao Liu and Shuming Shi},
  journal= {arXiv preprint arXiv:2201.02993},
  year   = {2022}
}