针对文本对抗攻击的快速对抗训练
计算与语言
2024-02-28 v1 人工智能
摘要
许多对抗防御方法已被提出以增强自然语言处理模型的对抗鲁棒性。然而,它们大多引入了额外的预设语言知识,并假设攻击者使用的同义词候选是可获取的,这是一个理想化的假设。我们深入研究了嵌入空间中的对抗训练,并从单步扰动生成和扰动初始化的角度,提出了一种快速对抗训练(FAT)方法,以在同义词不可知场景下提高模型鲁棒性。基于单步与多步梯度上升生成的对抗扰动相似的观察,FAT 使用单步梯度上升在嵌入空间中生成对抗样本来加速训练过程。基于同一训练样本在连续训练周期中生成的扰动相似的观察,FAT 在初始化扰动时充分利用了历史信息。大量实验表明,FAT 在同义词不可知场景下显著提升了 BERT 模型的鲁棒性,并在各种字符级和词级修改的攻击下优于防御基线。
引用
@article{arxiv.2401.12461,
title = {Fast Adversarial Training against Textual Adversarial Attacks},
author = {Yichen Yang and Xin Liu and Kun He},
journal= {arXiv preprint arXiv:2401.12461},
year = {2024}
}
备注
4 pages, 4 figures