中文

绕过 DARCY 防御:不可区分的通用对抗触发器

计算与语言 2024-09-06 v1 人工智能

摘要

用于自然语言处理(NLP)的神经网络(NN)分类模型容易受到通用对抗触发器(UAT)攻击,该攻击可触发模型对任何输入产生特定预测。DARCY借用“蜜罐”概念来诱饵多个陷阱门,有效检测由UAT生成的对抗样本。遗憾的是,我们发现了一种名为IndisUAT的新UAT生成方法,它生成触发器(即词元)并利用它们构造对抗样本,这些样本的特征分布在DARCY的检测层上与随机选定类别中的良性样本特征分布不可区分。生成的对抗样本在受DARCY保护的模型中导致预测结果的最大损失。同时,生成的触发器在文本生成、文本推理和阅读理解的黑盒模型中也很有效。最后,NLP任务下NN模型的评估结果表明,IndisUAT方法能够有效绕过DARCY并穿透其他防御。例如,IndisUAT能将DARCY检测的真阳性率分别降低至少40.8%和90.6%,并在RNN和CNN模型中分别使准确率下降至少33.3%和51.6%。IndisUAT将BERT对抗防御模型的准确率降低了至少34.0%,并使得GPT-2语言模型即使在以非种族语境为条件时也会输出种族主义言论。

关键词

引用

@article{arxiv.2409.03183,
  title  = {Bypassing DARCY Defense: Indistinguishable Universal Adversarial Triggers},
  author = {Zuquan Peng and Yuanyuan He and Jianbing Ni and Ben Niu},
  journal= {arXiv preprint arXiv:2409.03183},
  year   = {2024}
}

备注

13 pages, 5 figures