中文

通过对比学习与自编码器改进基于梯度的文本分类对抗训练

计算与语言 2021-09-15 v1

摘要

近期工作提出了若干在嵌入上生成基于梯度的对抗扰动的高效方法,并证明当模型用这些受污染的嵌入训练时,其性能与鲁棒性可得以提升。然而它们很少关注如何帮助模型更高效地学习这些对抗样本。本工作中,我们聚焦于在模型训练过程中增强其防御基于梯度的对抗攻击的能力,并提出两种新颖的对抗训练方法:(1) CARL 在表示空间中拉近原样本与其对抗样本,同时推远它们与不同标签样本的距离。(2) RAR 迫使模型从其对抗表示中重建原样本。实验表明,所提两种方法在多个文本分类数据集上优于强基线。分析实验发现,使用我们的方法时,输入句子的语义表示不会显著受对抗扰动影响,且模型在对抗攻击下性能下降更少。也就是说,我们的方法能有效提升模型的鲁棒性。此外,RAR 也可用于生成文本形式的对抗样本。

关键词

引用

@article{arxiv.2109.06536,
  title  = {Improving Gradient-based Adversarial Training for Text Classification by Contrastive Learning and Auto-Encoder},
  author = {Yao Qiu and Jinchao Zhang and Jie Zhou},
  journal= {arXiv preprint arXiv:2109.06536},
  year   = {2021}
}

备注

Accepted as a long paper at ACL 2021 (Findings)