重新审视自然语言处理中后门攻击攻击强度的评估
计算与语言
2022-02-17 v2 密码学与安全
机器学习
摘要
已有研究表明,自然语言处理(NLP)模型易受一种称为后门攻击(backdoor attack)的安全威胁,其利用“后门触发器”范式误导模型。最具威胁性的后门攻击是隐蔽后门攻击,其将触发器定义为文本风格或句法。尽管它们取得了极高的攻击成功率(ASR),我们发现导致其 ASR 的主要因素并非“后门触发器”范式。因此,当这些隐蔽后门攻击被归类为后门攻击时,其能力被高估了。为此,为评估后门攻击的真实攻击威力,我们提出了一种称为攻击成功率差值(ASRD)的新指标,用于衡量干净状态与投毒状态模型之间的 ASR 差异。此外,由于针对隐蔽后门攻击的防御手段缺失,我们提出了 Trigger Breaker,其包含两种极为简单的技巧,可有效防御隐蔽后门攻击。实验表明,我们的方法在抵御隐蔽后门攻击方面显著优于最先进的防御方法。
引用
@article{arxiv.2201.02993,
title = {Rethink the Evaluation for Attack Strength of Backdoor Attacks in Natural Language Processing},
author = {Lingfeng Shen and Haiyun Jiang and Lemao Liu and Shuming Shi},
journal= {arXiv preprint arXiv:2201.02993},
year = {2022}
}