中文

对抗扰动为何须不可感知?重思对抗 NLP 的研究范式

计算与语言 2022-10-20 v1 密码学与安全 机器学习

摘要

文本对抗样本在 NLP 研究的多个子领域中发挥重要作用,包括安全、评估、可解释性与数据增强。然而,多数工作混淆了所有这些角色,模糊了旨在揭示 NLP 模型实际隐患的安全角色的问题定义与研究目标。本文重思安全场景下文本对抗样本的研究范式。我们讨论先前工作的不足,并提出面向安全的对抗 NLP(SoadNLP)研究应:(1) 在安全任务上评估其方法以展示现实隐患;(2) 考虑真实攻击者的目标,而非开发不实用的方法。为此,我们首先收集、处理并发布安全数据集集合 Advbench。随后,我们重构任务并调整 SoadNLP 中不同目标的侧重。接着,我们提出一种基于启发式规则的简单方法,可轻松达成实际对抗目标以模拟真实世界攻击方法。我们在 Advbench 的攻击与防御两侧进行实验。实验结果表明我们的方法具有更高实用价值,意味着 SoadNLP 的研究范式或可从我们的新基准起步。Advbench 的所有代码与数据见 \url{https://github.com/thunlp/Advbench}。

关键词

引用

@article{arxiv.2210.10683,
  title  = {Why Should Adversarial Perturbations be Imperceptible? Rethink the Research Paradigm in Adversarial NLP},
  author = {Yangyi Chen and Hongcheng Gao and Ganqu Cui and Fanchao Qi and Longtao Huang and Zhiyuan Liu and Maosong Sun},
  journal= {arXiv preprint arXiv:2210.10683},
  year   = {2022}
}

备注

Accepted to EMNLP 2022, main conference