中文

最佳防御即攻击:修复文本对抗样本中的语义

计算与语言 2024-04-02 v2

摘要

近期研究揭示了预训练语言模型对对抗攻击的脆弱性。现有对抗防御技术试图在特征或文本空间内重建对抗样本。然而,这些方法难以有效修复对抗样本中的语义,导致性能不佳并限制其实用性。为修复对抗样本中的语义,我们引入一种名为响应式扰动去聚焦(Reactive Perturbation Defocusing, Rapid)的新方法。Rapid采用对抗检测器识别对抗样本的伪标签,并利用对抗攻击者修复对抗样本中的语义。我们在四个公开数据集上进行的广泛实验结果令人信服地证明了Rapid在各种对抗攻击场景下的有效性。为解决先前工作中防御性能验证的问题,我们基于本工作提供了对抗检测与修复的演示,可在 https://tinyurl.com/22ercuf8 轻松评估。

关键词

引用

@article{arxiv.2305.04067,
  title  = {The Best Defense is Attack: Repairing Semantics in Textual Adversarial Examples},
  author = {Heng Yang and Ke Li},
  journal= {arXiv preprint arXiv:2305.04067},
  year   = {2024}
}