中文

TextShield:超越文本分类中对抗性句子的成功检测

计算与语言 2023-02-07 v1 人工智能

摘要

对抗攻击是自然语言处理(NLP)中神经网络模型面临的主要挑战,它阻碍了模型在安全关键型应用中的部署。最近一系列基于检测的防御工作旨在区分对抗性句子和良性句子。然而,{先前检测方法的核心局限性在于,与其他范式的防御方法不同,它们无法对对抗性句子给出正确的预测。}为了解决这个问题,本文提出了TextShield:(1)我们发现了文本攻击与显著性信息之间的联系,然后提出了一种基于显著性的检测器,它可以有效检测输入句子是对抗性的还是良性的。(2)我们设计了一个基于显著性的校正器,它将检测到的对抗性句子转换为良性句子。通过结合基于显著性的检测器和校正器,TextShield将仅检测范式扩展为检测-校正范式,从而填补了现有基于检测的防御方法的空白。综合实验表明:(a)在不同基准数据集上针对各种攻击,TextShield始终取得优于或可比于最先进防御方法的性能。(b)我们的基于显著性的检测器在检测对抗性句子方面优于现有检测器。

关键词

引用

@article{arxiv.2302.02023,
  title  = {TextShield: Beyond Successfully Detecting Adversarial Sentences in Text Classification},
  author = {Lingfeng Shen and Ze Zhang and Haiyun Jiang and Ying Chen},
  journal= {arXiv preprint arXiv:2302.02023},
  year   = {2023}
}