基于梯度的词替换用于语言模型中顽固对抗样本生成
计算与语言
2023-08-21 v2 人工智能
密码学与安全
计算机与社会
摘要
在本文中,我们研究在 NLP 中通过词替换生成顽固(过稳定)对抗样本的问题,其中输入文本被有意义地改变但模型的预测未变,尽管本应改变。先前的词替换方法主要聚焦于为生成顽固对抗样本而人工设计的基于反义词的策略,这阻碍了它的应用,因为这些策略只能找到顽固对抗样本的子集且需要人力。为解决此问题,在本文中我们引入一种名为 GradObstinate 的新型词替换方法,一种基于梯度的方法,可自动生成顽固对抗样本,无需对搜索空间或人工设计原则有任何约束。为经验评估 GradObstinate 的有效性,我们在四个 NLP 基准(SST-2、MRPC、SNLI 和 SQuAD)和一个语言接地基准(MSCOCO)上微调的五个代表性模型(Electra、ALBERT、Roberta、DistillBERT 和 CLIP)上进行了综合实验。大量实验表明,我们提出的 GradObstinate 生成了更强大的顽固对抗样本,与基于反义词的方法相比展现出更高的攻击成功率。此外,为展示 GradObstinate 所发现的顽固词替换的可迁移性,我们将四个代表性 NLP 基准中的词替换为其顽固替换词。值得注意的是,在黑盒设置下,包括甚至 GPT-3 和 ChatGPT,顽固替换词迁移到其他模型时展现出高成功率。GradObstinate 发现的顽固对抗样本示例可在 https://huggingface.co/spaces/anonauthors/SecretLanguage 获取。
引用
@article{arxiv.2307.12507,
title = {Gradient-Based Word Substitution for Obstinate Adversarial Examples Generation in Language Models},
author = {Yimu Wang and Peng Shi and Hongyang Zhang},
journal= {arXiv preprint arXiv:2307.12507},
year = {2023}
}
备注
19 pages