SCAT:基于对抗训练的文本分类鲁棒自监督对比学习
计算与语言
2023-07-06 v1
摘要
尽管当前的自然语言处理(NLP)系统在各种任务上表现优异,但它们易受文本对抗攻击。为防御这些攻击,大多数现有方法通过引入对抗样本来应用对抗训练。然而,这些方法必须依赖真实标签来生成对抗样本,这使得其在当今 NLP 及许多其他任务中常用的大规模模型预训练中难以实用。本文提出一种称为 SCAT(基于对抗训练的自监督对比学习)的新型学习框架,它无需标注数据即可学习鲁棒表征。具体而言,SCAT 以完全无标签的方式修改数据的随机增强以生成对抗样本。通过最小化增强样本与其对抗对应样本之间的对比损失来实现对抗训练。我们使用近期提出的两种最先进攻击方案,在两个文本分类数据集上评估 SCAT。我们的结果表明,SCAT 不仅可以从头训练鲁棒的语言模型,还能显著提升现有预训练语言模型的鲁棒性。此外,为证明其灵活性,我们展示 SCAT 也可与有监督对抗训练结合以进一步增强模型鲁棒性。
引用
@article{arxiv.2307.01488,
title = {SCAT: Robust Self-supervised Contrastive Learning via Adversarial Training for Text Classification},
author = {Junjie Wu and Dit-Yan Yeung},
journal= {arXiv preprint arXiv:2307.01488},
year = {2023}
}