一种基于提示的对抗样本生成与鲁棒性增强方法
计算与语言
2022-03-22 v1
摘要
近年来,NLP 模型在金融、医疗和新闻媒体等关键领域的广泛应用引发了人们对模型鲁棒性和漏洞的担忧。本文提出一种新颖的基于提示的对抗攻击来攻破 NLP 模型及鲁棒性增强技术。我们首先为每个实例构造恶意提示,并在恶意目的作用下通过掩码填充生成对抗样本。我们的攻击技术针对 NLP 模型固有的漏洞,只要其基于预训练语言模型(PLMs),即使不与受害 NLP 模型交互也能生成样本。此外,我们设计了一种基于提示的对抗训练方法以提升 PLM 的鲁棒性。由于我们的训练方法并不实际生成对抗样本,因此可高效应用于大规模训练集。实验结果表明,我们的攻击方法能以更多样、流畅且自然的对抗样本实现高攻击成功率。此外,我们的鲁棒性增强方法能显著提升模型抵御对抗攻击的鲁棒性。我们的工作表明,提示范式在探查 PLM 的一些基本缺陷并为其下游任务微调方面具有巨大潜力。
引用
@article{arxiv.2203.10714,
title = {A Prompting-based Approach for Adversarial Example Generation and Robustness Enhancement},
author = {Yuting Yang and Pei Huang and Juan Cao and Jintao Li and Yun Lin and Jin Song Dong and Feifei Ma and Jian Zhang},
journal= {arXiv preprint arXiv:2203.10714},
year = {2022}
}