中文

“那是个可疑的反应!”:解读 Logits 变化以检测 NLP 对抗攻击

人工智能 2023-06-30 v2 计算与语言 机器学习

摘要

对抗攻击是当前机器学习研究面临的主要挑战。这些精心构造的输入甚至能欺骗最先进的模型,阻碍其在安全关键应用中的部署。计算机视觉领域已开展大量研究以开发可靠的防御策略。然而,自然语言处理中同一问题仍较少被探索。我们的工作提出了一种模型无关的对抗文本样本检测器。该方法在扰动输入文本时识别目标分类器 logits 中的模式。所提检测器在识别对抗输入方面提升了当前最优性能,并对不同 NLP 模型、数据集与词级攻击展现出强泛化能力。

关键词

引用

@article{arxiv.2204.04636,
  title  = {"That Is a Suspicious Reaction!": Interpreting Logits Variation to Detect NLP Adversarial Attacks},
  author = {Edoardo Mosca and Shreyash Agarwal and Javier Rando and Georg Groh},
  journal= {arXiv preprint arXiv:2204.04636},
  year   = {2023}
}

备注

ACL 2022