中文

重新审视语言模型的字符级对抗攻击

机器学习 2024-09-05 v2 人工智能 计算与语言 机器学习

摘要

自然语言处理中的对抗攻击在字符或词元级别施加扰动。词元级攻击因其使用基于梯度的方法而受到关注,但容易改变句子语义,导致无效的对抗样本。字符级攻击虽然容易保持语义,但受到的关注较少,因为它们不容易采用流行的基于梯度的方法,并且被认为易于防御。挑战这些观点,我们引入了Charmer,一种高效的基于查询的对抗攻击,能够在生成高度相似的对抗样本的同时实现高攻击成功率(ASR)。我们的方法成功攻击了小型(BERT)和大型(Llama 2)模型。具体来说,在BERT with SST-2上,Charmer在ASR上提高了4.84个百分点,在USE相似度上提高了8个百分点。我们的实现可在https://github.com/LIONS-EPFL/Charmer获取。

关键词

引用

@article{arxiv.2405.04346,
  title  = {Revisiting Character-level Adversarial Attacks for Language Models},
  author = {Elias Abad Rocamora and Yongtao Wu and Fanghui Liu and Grigorios G. Chrysos and Volkan Cevher},
  journal= {arXiv preprint arXiv:2405.04346},
  year   = {2024}
}

备注

Accepted in ICML 2024