利用对抗扰动进行自监督对比学习以防御基于词替换的攻击
计算与语言
2022-05-25 v3
摘要
在本文中,我们提出一种方法,通过利用对抗扰动进行自监督对比学习,提升 BERT 语言模型针对基于词替换的对抗攻击的鲁棒性。我们在对比学习过程中即时生成词级对抗攻击作为困难正样本(hard positives)以充当对抗样本。与以往工作不同,我们的方法无需使用任何标注数据即可提升模型鲁棒性。实验结果表明,我们的方法提升了 BERT 针对四种不同基于词替换的对抗攻击的鲁棒性,且将我们的方法与对抗训练相结合比单独使用对抗训练具有更高的鲁棒性。由于我们的方法纯粹利用无标注数据提升 BERT 的鲁棒性,这为使用大规模文本数据集训练抵御基于词替换的对抗攻击的鲁棒语言模型提供了可能。
引用
@article{arxiv.2107.07610,
title = {Self-Supervised Contrastive Learning with Adversarial Perturbations for Defending Word Substitution-based Attacks},
author = {Zhao Meng and Yihan Dong and Mrinmaya Sachan and Roger Wattenhofer},
journal= {arXiv preprint arXiv:2107.07610},
year = {2022}
}
备注
In Findings of NAACL 2022