中文

基于文本流形的自然语言对抗样本防御方法

计算与语言 2022-11-08 v1 密码学与安全 机器学习

摘要

近期关于对抗图像的研究表明,对抗图像往往偏离潜在的低维数据流形,使得当前模型更难做出正确预测。这一所谓的离流形猜想启发了针对图像对抗攻击的一类新型防御方法。在本研究中,我们发现由预训练语言模型诱导的上下文嵌入空间中存在类似现象:对抗文本的嵌入倾向于偏离自然文本的流形。基于该发现,我们提出基于文本流形的防御(Textual Manifold-based Defense, TMD),一种在分类前将文本嵌入投影到近似嵌入流形上的防御机制。它降低了潜在对抗样本的复杂度,从而最终增强了受保护模型的鲁棒性。通过大量实验,我们的方法在各种攻击设定下始终显著优于以往的防御方法,且不牺牲干净样本的准确率。据我们所知,这是首个利用流形结构抵御对抗攻击的 NLP 防御方法。我们的代码已发布于 \url{https://github.com/dangne/tmd}。

关键词

引用

@article{arxiv.2211.02878,
  title  = {Textual Manifold-based Defense Against Natural Language Adversarial Examples},
  author = {Dang Minh Nguyen and Luu Anh Tuan},
  journal= {arXiv preprint arXiv:2211.02878},
  year   = {2022}
}