SemRoDe:学习对词级攻击鲁棒的表示的宏对抗训练
计算与语言
2024-03-28 v1 机器学习
摘要
语言模型(LMs)是自然语言处理任务不可或缺的工具,但其对对抗攻击的脆弱性仍令人担忧。虽然当前研究已经探索了对抗训练技术,但它们在防御词级攻击方面的改进有限。在本工作中,我们提出了一种名为语义鲁棒防御(Semantic Robust Defence, SemRoDe)的新方法,这是一种增强 LM 鲁棒性的宏对抗训练策略。受图像域近期研究的启发,我们研究并随后确认,在如语言这样的离散数据设置中,通过词语替换生成的对抗样本确实属于一个与基础域表现出高 Wasserstein 距离的对抗域。我们的方法学习连接这两个域的鲁棒表示。我们假设,如果样本不被投影到对抗域中,而是投影到一个偏移最小的域中,将提高攻击鲁棒性。我们通过引入一个新的基于距离的目标来对齐这些域。借此,我们的模型能够通过对其高级输出特征进行对齐来学习更具泛化性的表示,从而更好地处理未见过的对抗样本。该方法可泛化至不同的词嵌入,即使它们在词汇表和词替换层面上的重叠极少。为了评估我们方法的有效性,我们在三个数据集上对 BERT 和 RoBERTa 模型进行了实验。结果展现出了有前景的最先进的鲁棒性。
关键词
引用
@article{arxiv.2403.18423,
title = {SemRoDe: Macro Adversarial Training to Learn Representations That are Robust to Word-Level Attacks},
author = {Brian Formento and Wenjie Feng and Chuan Sheng Foo and Luu Anh Tuan and See-Kiong Ng},
journal= {arXiv preprint arXiv:2403.18423},
year = {2024}
}
备注
Published in NAACL 2024 (Main Track)