探索基于提示的学习范式的普遍脆弱性
计算与语言
2022-04-12 v1
摘要
基于提示的学习范式弥合了预训练与微调之间的差距,并在少样本设定下有效工作。然而,我们发现这种学习范式继承了预训练阶段的脆弱性,即通过向文本中插入特定触发器可以误导模型预测。在本文中,我们通过在预训练语言模型上仅使用纯文本注入后门触发器或搜索对抗触发器来探索这种普遍脆弱性。在这两种情形下,我们均表明我们的触发器能够完全控制或严重降低在任意下游任务上微调的基于提示的模型的性能,反映出基于提示的学习范式的普遍脆弱性。进一步的实验表明,对抗触发器在语言模型之间具有良好的可迁移性。我们还发现传统的微调模型不易受从预训练语言模型构建的对抗触发器的影响。最后,我们提出一种潜在的解决方案来缓解我们的攻击方法。代码和数据公开于 https://github.com/leix28/prompt-universal-vulnerability
引用
@article{arxiv.2204.05239,
title = {Exploring the Universal Vulnerability of Prompt-based Learning Paradigm},
author = {Lei Xu and Yangyi Chen and Ganqu Cui and Hongcheng Gao and Zhiyuan Liu},
journal= {arXiv preprint arXiv:2204.05239},
year = {2022}
}
备注
Accepted to Findings of NAACL 2022