面向上下文语言表示的对抗训练
计算与语言
2023-05-09 v1
摘要
尽管在基于预训练语言模型(PLMs)的文本领域近期对抗训练(AT)取得了成功,我们的实证研究显示 AT 在某些任务(如常识推理、命名实体识别)上的收益并不一致。本文从 PLM 编码器输出的上下文语言表示视角考察 AT。我们发现当前的 AT 攻击倾向于生成次优对抗样本,这些样本能欺骗解码器部分,但对编码器影响甚微。然而,我们发现有必要有效偏离后者才能使 AT 获得收益。基于该观察,我们提出简单而有效的\textit{上下文表示-对抗训练}(CreAT),其中攻击被显式优化以偏离编码器的上下文表示。它允许对抗样本的全局优化,从而能欺骗整个模型。我们还发现 CreAT 给出了优化对抗样本的更好方向,使其对超参数不那么敏感。与 AT 相比,CreAT 在更广的任务范围内产生了一致的性能提升,并被证明对仅保留编码器部分用于下游任务的语言预训练更为有效。我们在一系列具有挑战性的基准上取得了新的 SOTA 性能,例如 AdvGLUE (59.1 61.1)、HellaSWAG (93.0 94.9)、ANLI (68.1 69.3)。
引用
@article{arxiv.2305.04557,
title = {Toward Adversarial Training on Contextualized Language Representation},
author = {Hongqiu Wu and Yongxiang Liu and Hanwen Shi and Hai Zhao and Min Zhang},
journal= {arXiv preprint arXiv:2305.04557},
year = {2023}
}