中文

Fine-mixing:缓解微调语言模型中的后门

计算与语言 2022-10-19 v1 密码学与安全 机器学习

摘要

深度神经网络(DNNs)已知易受后门攻击。在自然语言处理(NLP)中,DNNs常在大规模预训练语言模型(PLM)借助投毒样本进行微调的过程中被植入后门。尽管PLM的干净权重易于获取,现有方法在防御NLP模型的后门攻击时忽视了这一信息。本文中,我们首次利用预训练(未微调)权重来缓解微调语言模型中的后门。具体而言,我们通过两种互补技术来利用干净的预训练权重:(1)一种两步Fine-mixing技术,先将后门权重(在投毒数据上微调得到)与预训练权重混合,再在少量干净数据子集上微调混合后的权重;(2)一种嵌入净化(E-PUR)技术,缓解词嵌入中存在的潜在后门。我们在三个单句情感分类任务和两个句对分类任务上将Fine-mixing与典型的后门缓解方法进行比较,结果表明在所有场景下它以明显优势优于基线。我们还展示了E-PUR方法可惠及现有缓解方法。我们的工作为抵御后门攻击的安全微调NLP模型建立了一个简单但强大的基线防御。

关键词

引用

@article{arxiv.2210.09545,
  title  = {Fine-mixing: Mitigating Backdoors in Fine-tuned Language Models},
  author = {Zhiyuan Zhang and Lingjuan Lyu and Xingjun Ma and Chenguang Wang and Xu Sun},
  journal= {arXiv preprint arXiv:2210.09545},
  year   = {2022}
}

备注

Accepted by Findings of EMNLP 2022