重新审视语言模型的字符级对抗攻击
机器学习
2024-09-05 v2 人工智能
计算与语言
机器学习
摘要
自然语言处理中的对抗攻击在字符或词元级别施加扰动。词元级攻击因其使用基于梯度的方法而受到关注,但容易改变句子语义,导致无效的对抗样本。字符级攻击虽然容易保持语义,但受到的关注较少,因为它们不容易采用流行的基于梯度的方法,并且被认为易于防御。挑战这些观点,我们引入了Charmer,一种高效的基于查询的对抗攻击,能够在生成高度相似的对抗样本的同时实现高攻击成功率(ASR)。我们的方法成功攻击了小型(BERT)和大型(Llama 2)模型。具体来说,在BERT with SST-2上,Charmer在ASR上提高了4.84个百分点,在USE相似度上提高了8个百分点。我们的实现可在https://github.com/LIONS-EPFL/Charmer获取。
引用
@article{arxiv.2405.04346,
title = {Revisiting Character-level Adversarial Attacks for Language Models},
author = {Elias Abad Rocamora and Yongtao Wu and Fanghui Liu and Grigorios G. Chrysos and Volkan Cevher},
journal= {arXiv preprint arXiv:2405.04346},
year = {2024}
}
备注
Accepted in ICML 2024