学习忽略对抗攻击
计算与语言
2023-02-22 v2 人工智能
摘要
尽管当前 NLP 模型性能强劲,它们可能对抗对抗攻击脆弱。为实现针对对抗输入的有效学习,我们引入使用显式学习忽略攻击 token 的 rationale 模型。我们发现 rationale 模型可成功忽略超过 90% 的攻击 token。该方法在 BERT 与 RoBERTa 的三个数据集上相较基线模型带来一致且可观的鲁棒性提升(10%),并且可靠地优于仅用对抗样本的数据增强。在许多情况下,我们发现我们的方法能够缩小干净测试集与受攻击测试集间模型性能的差距,从而降低对抗攻击的影响。
引用
@article{arxiv.2205.11551,
title = {Learning to Ignore Adversarial Attacks},
author = {Yiming Zhang and Yangqiaoyu Zhou and Samuel Carton and Chenhao Tan},
journal= {arXiv preprint arXiv:2205.11551},
year = {2023}
}
备注
EACL 2023, code is available at https://github.com/ChicagoHAI/rationalization-robustness