中文

打破、模仿、修复:通过生成类人攻击实现鲁棒性

机器学习 2024-02-16 v2

摘要

现实世界的自然语言处理系统需要对人类对手具有鲁棒性。收集人类对手的示例用于训练是一种有效但昂贵的解决方案。另一方面,在带有微小扰动(如词语替换)的合成攻击上训练并不能真正提升对人类对手的鲁棒性。在本文中,我们提出了一种对抗训练框架,利用有限的人类对抗示例大规模生成更有用的对抗示例。我们在 ANLI 和仇恨言论检测基准数据集上展示了该系统的优势——两者均通过迭代的、人类与模型在环的对抗式过程收集。与仅在观察到的人类攻击上训练相比,同时在我们合成的对抗性示例上训练可提升模型对未来轮次的鲁棒性。在 ANLI 中,我们在当前攻击集(44.1%\,\to\,50.1%)和两轮未来未见的人类生成攻击(32.5%\,\to\,43.4%,以及 29.4%\,\to\,40.2%)上看到了准确率提升。在仇恨言论检测中,我们在当前攻击(0.76 \to 0.84)和未来一轮(0.77 \to 0.79)上看到了 AUC 提升。与此同时,未学习现有人类对手分布的方法所生成的攻击会降低鲁棒性。

关键词

引用

@article{arxiv.2310.16955,
  title  = {Break it, Imitate it, Fix it: Robustness by Generating Human-Like Attacks},
  author = {Aradhana Sinha and Ananth Balashankar and Ahmad Beirami and Thi Avrahami and Jilin Chen and Alex Beutel},
  journal= {arXiv preprint arXiv:2310.16955},
  year   = {2024}
}