中文

基于数据表示分布特性的文本对抗样本检测

计算与语言 2022-05-02 v1 机器学习

摘要

尽管深度神经网络在各种机器学习任务中取得了最先进的性能,但通过对正确分类的输入添加小的非随机扰动而构造的对抗样本,能成功欺骗高表达力的深度分类器做出错误预测。过去五年中,自然语言任务中的对抗攻击方法借助字符级、词级、短语级或句子级文本扰动迅速涌现。虽然NLP中有一些通过主动方法(如对抗训练)防御此类攻击的工作,但据我们所知,尚无可行的通用反应性方法通过检测文本对抗样本来防御,如图像处理文献中所见。本文中,我们提出两种NLP新型反应性方法以填补此空白,其与NLP中少数有限应用的基线不同,完全基于学习表示的分布特性:我们从图像处理文献中改编一种(局部本征维数(LID)),并提出一种新方法(多距离表示集成方法(MDRE))。改编的LID与MDRE在IMDB数据集的字符级、词级和短语级攻击,以及MultiNLI数据集的后两级攻击上均取得最先进结果。为未来研究,我们公开了代码。

关键词

引用

@article{arxiv.2204.13853,
  title  = {Detecting Textual Adversarial Examples Based on Distributional Characteristics of Data Representations},
  author = {Na Liu and Mark Dras and Wei Emma Zhang},
  journal= {arXiv preprint arXiv:2204.13853},
  year   = {2022}
}

备注

13 pages, RepL4NLP 2022