中文

基于归因防御插入式文本后门攻击

计算与语言 2023-08-08 v2 人工智能 密码学与安全 机器学习

摘要

文本后门攻击作为一种新型攻击模型,已被证明能在训练过程中向模型植入后门。防御此类后门攻击已变得紧迫且重要。本文提出 AttDef,一种高效的基于归因的流水线,用于防御两种插入式投毒攻击 BadNL 与 InSent。具体而言,我们将具有较大归因分数的词元视为潜在触发器,因为归因值较大的词对错误预测结果贡献更多,因而更可能是投毒触发器。此外,我们进一步利用外部预训练语言模型来区分输入是否被投毒。我们表明,所提方法能在两种常见攻击场景(投毒训练数据与投毒测试数据)中充分泛化,并持续优于先前方法。例如,AttDef 在预训练与训练后攻击防御下分别以平均 79.97%(提升 56.59%)与 48.34%(提升 3.99%)的准确率成功缓解两种攻击,在四个基准数据集的预测恢复上达到新的 SOTA 性能。

关键词

引用

@article{arxiv.2305.02394,
  title  = {Defending against Insertion-based Textual Backdoor Attacks via Attribution},
  author = {Jiazhao Li and Zhuofeng Wu and Wei Ping and Chaowei Xiao and V. G. Vinod Vydiswaran},
  journal= {arXiv preprint arXiv:2305.02394},
  year   = {2023}
}

备注

Findings of ACL 2023. Camera-ready version