中文

面向 NLP 模型对抗训练改进的探索

计算与语言 2021-09-14 v2 人工智能 机器学习

摘要

对抗训练是一种学习鲁棒深度神经网络的方法,它在训练过程中构造对抗样本。然而,现有的 NLP 对抗样本生成方法涉及组合搜索和昂贵的句子编码器以约束生成的实例。因此,使用原始对抗训练来提升 NLP 模型性能仍然具有挑战性,且其益处主要未被探究。本文提出了一种简单且改进的原始 NLP 模型对抗训练流程,我们称之为 Attacking to Training (A2T)。A2T 的核心是一个为原始对抗训练优化的、新的且更廉价的词替换攻击。我们使用 A2T 在 IMDB、Rotten Tomatoes、Yelp 和 SNLI 数据集上训练 BERT 和 RoBERTa 模型。我们的结果从经验上表明,使用廉价得多的对手来训练鲁棒 NLP 模型是可能的。我们证明,采用 A2T 的原始对抗训练能够提升 NLP 模型对其最初训练所用攻击的鲁棒性,并能防御其他类型的词替换攻击。此外,我们展示了 A2T 能够提升 NLP 模型的标准准确率、跨域泛化能力和可解释性。代码见 https://github.com/QData/Textattack-A2T。

关键词

引用

@article{arxiv.2109.00544,
  title  = {Towards Improving Adversarial Training of NLP Models},
  author = {Jin Yong Yoo and Yanjun Qi},
  journal= {arXiv preprint arXiv:2109.00544},
  year   = {2021}
}

备注

EMNLP Findings 2021