中文

通过随机化隐表示愚弄文本愚弄者

计算与语言 2024-06-11 v2 人工智能

摘要

尽管在多种 NLP 任务中表现优异,近期研究揭示 NLP 模型易受对抗攻击,此类攻击对输入稍加扰动即可导致模型行为失常。在这些攻击中,对抗词级扰动是被充分研究且有效的攻击策略。由于这些攻击在黑盒设定下运作,无需访问模型架构或模型参数,因而可能对现有 NLP 应用造成危害。为实施攻击, adversary 多次查询受害模型以确定输入文本中最重要的词,并将这些词替换为其对应同义词。本工作中,我们提出一种轻量且攻击无关的防御,其主要目标是扰乱此类基于查询的黑盒攻击中对抗样本的生成过程;即愚弄文本愚弄者。该防御名为 AdvFooler,通过在推理时随机化输入的隐表示来工作。与现有防御不同,AdvFooler 在训练时无需额外计算开销,也不依赖关于潜在对抗扰动集的假设,同时对模型准确率影响甚微。我们的理论与实证分析凸显了通过随机化隐空间迷惑 adversary 所带来的鲁棒性意义,以及随机化对干净准确率的影响。最后,我们在两个基准数据集上针对代表性对抗词级攻击实证展示了 AdvFooler 接近 SOTA 的鲁棒性。

关键词

引用

@article{arxiv.2310.01452,
  title  = {Fooling the Textual Fooler via Randomizing Latent Representations},
  author = {Duy C. Hoang and Quang H. Nguyen and Saurav Manchanda and MinLong Peng and Kok-Seng Wong and Khoa D. Doan},
  journal= {arXiv preprint arXiv:2310.01452},
  year   = {2024}
}

备注

Accepted to Findings of ACL 2024