面向词级对抗攻击的鲁棒文本嵌入
计算与语言
2022-07-28 v2
摘要
我们将自然语言处理模型易受攻击的原因归结为相似输入在嵌入空间中被转换为不相似的表示,从而导致不一致的输出,并提出了一种称为快速三元组度量学习(Fast Triplet Metric Learning, FTML)的新型鲁棒训练方法。具体而言,我们认为原始样本应与其对抗样本具有相似的表示,并使其表示区别于其他样本以获得更好的鲁棒性。为此,我们将三元组度量学习引入标准训练中,在嵌入空间将词拉近其正样本(即同义词)并推远其负样本(即非同义词)。大量实验表明,FTML 能显著提升模型针对多种先进对抗攻击的鲁棒性,同时在原始样本上保持有竞争力的分类准确率。此外,我们的方法高效,因为它只需调整嵌入层,并在标准训练中引入极小的开销。我们的工作展示了通过鲁棒词嵌入提升文本鲁棒性的巨大潜力。
引用
@article{arxiv.2202.13817,
title = {Robust Textual Embedding against Word-level Adversarial Attacks},
author = {Yichen Yang and Xiaosen Wang and Kun He},
journal= {arXiv preprint arXiv:2202.13817},
year = {2022}
}
备注
Accepted by UAI 2022, code is available at https://github.com/JHL-HUST/FTML