中文

DARCY的甜蜜陷阱:利用蜜罐检测通用触发器的对抗攻击

密码学与安全 2021-05-10 v3 计算与语言 机器学习

摘要

通用触发器(UniTrigger)是近期提出的一种强有力对抗性文本攻击方法。利用基于学习的机制,UniTrigger生成一固定短语,将其加入任意良性输入后,可使文本神经网络(NN)模型在目标类上的预测准确率降至近零。为防御这种可造成严重危害的攻击,本文从网络安全界借用了“蜜罐(honeypot)”概念,提出DARCY,一种基于蜜罐的针对UniTrigger的防御框架。DARCY贪心地搜索并向NN模型中注入多个陷阱门(trapdoor)以“诱捕”潜在攻击。通过在四个公开数据集上的综合实验,我们表明DARCY在大多数情况下以高达99%的TPR和低于2%的FPR检测UniTrigger的对抗攻击,同时将干净输入的预测准确率(F1)保持在1%以内。我们还证明带有多个陷阱门的DARCY对攻击者不同知识水平与技能的多种攻击场景亦具鲁棒性。源代码将在本文被接收后发布。

关键词

引用

@article{arxiv.2011.10492,
  title  = {A Sweet Rabbit Hole by DARCY: Using Honeypots to Detect Universal Trigger's Adversarial Attacks},
  author = {Thai Le and Noseong Park and Dongwon Lee},
  journal= {arXiv preprint arXiv:2011.10492},
  year   = {2021}
}

备注

Accepted to the 59th Annual Meeting of the Association for Computational Linguistics (ACL) 2021