SAFER:一种针对对抗性词替换实现认证鲁棒性的无结构方法
机器学习
2020-06-01 v1 计算与语言
密码学与安全
机器学习
摘要
最先进的NLP模型常常会被同义词替换等人类难以察觉的变换所欺骗。出于安全原因,开发具有认证鲁棒性的模型至关重要,此类模型能够可证明地保证其预测结果不会被任何可能的同义词替换所改变。在本工作中,我们提出了一种基于新随机平滑技术的认证鲁棒方法,该技术通过对输入句子应用随机词替换来构建随机集成,并利用集成的统计特性来可证明地认证鲁棒性。我们的方法简单且无结构,仅需模型输出的黑盒查询,因此可应用于任何预训练模型(如BERT)以及任何类型的模型(词级或子词级)。我们的方法在IMDB和Amazon文本分类任务上的认证鲁棒性显著优于近期最先进的方法。据我们所知,我们是首个在BERT等大型系统上实现具有实际意义的认证准确率并达到认证鲁棒性的工作。
引用
@article{arxiv.2005.14424,
title = {SAFER: A Structure-free Approach for Certified Robustness to Adversarial Word Substitutions},
author = {Mao Ye and Chengyue Gong and Qiang Liu},
journal= {arXiv preprint arXiv:2005.14424},
year = {2020}
}
备注
ACL 2020