“那是个可疑的反应!”:解读 Logits 变化以检测 NLP 对抗攻击
人工智能
2023-06-30 v2 计算与语言
机器学习
摘要
对抗攻击是当前机器学习研究面临的主要挑战。这些精心构造的输入甚至能欺骗最先进的模型,阻碍其在安全关键应用中的部署。计算机视觉领域已开展大量研究以开发可靠的防御策略。然而,自然语言处理中同一问题仍较少被探索。我们的工作提出了一种模型无关的对抗文本样本检测器。该方法在扰动输入文本时识别目标分类器 logits 中的模式。所提检测器在识别对抗输入方面提升了当前最优性能,并对不同 NLP 模型、数据集与词级攻击展现出强泛化能力。
引用
@article{arxiv.2204.04636,
title = {"That Is a Suspicious Reaction!": Interpreting Logits Variation to Detect NLP Adversarial Attacks},
author = {Edoardo Mosca and Shreyash Agarwal and Javier Rando and Georg Groh},
journal= {arXiv preprint arXiv:2204.04636},
year = {2023}
}
备注
ACL 2022