中文

迈向更强的文本对抗攻击检测器

计算与语言 2023-10-24 v1

摘要

可用的文本对抗攻击手段不断增多,对深度 NLP 系统的完整性构成严重威胁并引发担忧。然而,防御恶意攻击这一关键问题仅引起了 NLP 社区的关注,而后者对于开发稳健且可信的系统至关重要。本文在这一研究方向上做出两项重要贡献:(i) 我们提出 LAROUSSE,一种用于检测文本对抗攻击的新框架;(ii) 我们提出 STAKEOUT,一个由九种流行攻击方法、三个数据集和两个预训练模型组成的新基准。LAROUSSE 可直接用于生产环境,因为它是无监督、无超参数且不可微分的,从而能够抵御基于梯度的攻击方法。我们的新基准 STAKEOUT 提供了一个稳健的评估框架:我们进行了大量数值实验,表明 LAROUSSE 优于以往方法,并能够识别出导致检测率变化的若干有趣因素。

关键词

引用

@article{arxiv.2310.14001,
  title  = {Toward Stronger Textual Attack Detectors},
  author = {Pierre Colombo and Marine Picot and Nathan Noiry and Guillaume Staerman and Pablo Piantanida},
  journal= {arXiv preprint arXiv:2310.14001},
  year   = {2023}
}

备注

Findings EMNLP 2023