中文

自然语言对抗攻击中的样本可攻击性

计算与语言 2023-06-26 v1 人工智能

摘要

自然语言处理(NLP)中的对抗攻击研究在设计强大的攻击方法和防御方法方面已取得显著进展。然而,很少有工作试图识别哪些源样本最具可攻击性或鲁棒性,即我们能否针对未见目标模型确定哪些样本最容易受到对抗攻击。本文正式扩展了 NLP 攻击中样本可攻击性/鲁棒性的定义。在两个流行 NLP 数据集、四个最先进模型和四种不同 NLP 对抗攻击方法上的实验表明,样本不确定性不足以描述可攻击/鲁棒样本的特征,因此基于深度学习的检测器在识别未见目标模型最具可攻击性和鲁棒性的样本方面表现更好。然而,进一步分析发现,不同 NLP 攻击方法在哪些样本被视为最具可攻击性/鲁棒性上几乎无共识,这解释了攻击性检测方法的跨攻击方法可移植性的缺乏。

关键词

引用

@article{arxiv.2306.12043,
  title  = {Sample Attackability in Natural Language Adversarial Attacks},
  author = {Vyas Raina and Mark Gales},
  journal= {arXiv preprint arXiv:2306.12043},
  year   = {2023}
}

备注

arXiv admin note: text overlap with arXiv:2301.12896