中文

RedHerring 攻击:测试攻击检测的可靠性

计算与语言 2025-09-26 v1

摘要

针对对抗性文本攻击,人们提出了攻击检测模型,并已证明其能够成功识别攻击者修改的文本。攻击检测模型可用于为 NLP 模型提供额外检查,并为人类输入提供信号。然而,这些模型的可靠性尚未得到充分探索。因此,我们提出并测试了一种新型攻击设置和攻击方式——RedHerring。RedHerring 旨在通过修改文本使检测模型预测为攻击,同时保持分类器的正确性,从而让检测模型变得不可靠。这在分类器和检测器之间制造了紧张关系。如果人类看到检测器给出了"错误"的预测,但分类器给出了正确的预测,那么人类将认为检测器不可靠。我们在 4 个数据集上针对 3 个检测器(保护 4 个分类器)测试了这一新型威胁模型。我们发现 RedHerring 能够在保持(或提升)分类器准确率的同时,将检测准确率降低 20 至 71 个百分点。作为初步防御,我们提出了一种简单的置信度检查,无需重新训练分类器或检测器,即可显著提升检测准确率。这一新型威胁模型为攻击者如何针对检测模型提供了新的见解。

关键词

引用

@article{arxiv.2509.20691,
  title  = {RedHerring Attack: Testing the Reliability of Attack Detection},
  author = {Jonathan Rusert},
  journal= {arXiv preprint arXiv:2509.20691},
  year   = {2025}
}

备注

16 pages, 3 figures, Accepted to EMNLP 2025