中文

通过信息瓶颈提升 NLP 模型的对抗鲁棒性

计算与语言 2022-06-14 v1

摘要

已有研究表明,对抗样本可直接归因于非鲁棒特征的存在,这些特征具有高度预测性,但易被对抗者操纵以欺骗 NLP 模型。在本研究中,我们探索利用信息瓶颈理论捕获任务特定的鲁棒特征,同时消除非鲁棒特征的可行性。通过大量实验,我们表明使用我们基于信息瓶颈的方法训练的模型能够在鲁棒准确率上取得显著提升,在 SST-2、AGNEWS 和 IMDB 数据集上超越所有已有防御方法的性能,同时在干净准确率上几乎无性能下降。

关键词

引用

@article{arxiv.2206.05511,
  title  = {Improving the Adversarial Robustness of NLP Models by Information Bottleneck},
  author = {Cenyuan Zhang and Xiang Zhou and Yixin Wan and Xiaoqing Zheng and Kai-Wei Chang and Cho-Jui Hsieh},
  journal= {arXiv preprint arXiv:2206.05511},
  year   = {2022}
}