中文

通过随机替换与投票检测文本对抗样本

计算与语言 2022-07-21 v2 机器学习

摘要

一系列工作表明自然语言处理模型易受对抗样本攻击。相应地,人们提出了多种防御方法来缓解文本对抗样本的威胁,例如对抗训练、输入变换、检测等。本工作中,我们将基于同义替换的文本对抗攻击的优化过程视为一种特定的词语替换序列,其中每个词相互影响其他词。我们确认可通过将词随机替换为其同义词来破坏这种相互作用并消除对抗扰动。基于该观察,我们提出一种新颖的文本对抗样本检测方法,称为随机替换与投票(RS&V),它通过累积对输入文本中词语随机同义替换所生成的k个样本的对数几率(logits)来投票预测标签。所提出的RS&V通常适用于任何现有神经网络,无需修改架构或额外训练,并且与先前使分类网络自身更鲁棒的工作正交。在三个基准数据集上的实证评估表明,我们的RS&V比现有检测方法能更成功地检测文本对抗样本,同时在良性样本上保持高分类准确率。

关键词

引用

@article{arxiv.2109.05698,
  title  = {Detecting Textual Adversarial Examples through Randomized Substitution and Vote},
  author = {Xiaosen Wang and Yifeng Xiong and Kun He},
  journal= {arXiv preprint arXiv:2109.05698},
  year   = {2022}
}

备注

Accepted by UAI 2022, code is avaliable at https://github.com/JHL-HUST/RSV