基于提示的模型微调使 NLP 模型具备对抗鲁棒性
计算与语言
2023-12-07 v2 机器学习
摘要
近年来,NLP 从业者趋于采用以下做法:(i)导入现成的预训练(掩码)语言模型;(ii)在 CLS 标记的隐藏表示之上附加一个多层感知机(权重随机初始化);(iii)在下游任务上微调整个模型(MLP-FT)。该流程在标准 NLP 基准上带来了巨大提升,但这些模型仍然脆弱,即便面对轻微的对抗扰动也是如此。在本工作中,我们展示了通过提示进行模型微调(MVP)——一种适应下游任务的替代方法——所带来的对抗鲁棒性上的惊人提升。MVP 不附加 MLP 头进行输出预测,而是向输入附加提示模板,并通过文本填充/补全进行预测。在 5 个 NLP 数据集、4 种对抗攻击和 3 种不同模型上,MVP 相较标准方法在对抗替换下的性能平均提升 8%,甚至以 3.5% 优于基于对抗训练的最先进防御。通过将 MVP 与对抗训练结合,我们在保持未扰动样本性能的同时实现了对抗鲁棒性的进一步提升。最后,我们进行消融实验以探究这些增益背后的机制。值得注意的是,我们发现 MLP-FT 脆弱性的主要原因可归因于预训练与微调任务之间的错位,以及随机初始化的 MLP 参数。
引用
@article{arxiv.2303.07320,
title = {Model-tuning Via Prompts Makes NLP Models Adversarially Robust},
author = {Mrigank Raman and Pratyush Maini and J. Zico Kolter and Zachary C. Lipton and Danish Pruthi},
journal= {arXiv preprint arXiv:2303.07320},
year = {2023}
}
备注
Accepted to the EMNLP 2023 Conference