中文

扩散理论作为手术刀:检测并净化预训练语言模型中由后门或偏见导致的毒维

计算与语言 2023-05-09 v1

摘要

预训练语言模型(PLMs)可能在微调过程中被可疑攻击者注入后门或偏见而带毒。净化潜在有毒 PLM 的一个核心挑战是精确找出有毒维度。为解决此问题,我们提出 Fine-purifying 方法,利用扩散理论研究微调的动态过程以发现潜在有毒维度。根据不同维度的参数漂移与 Hessian 矩阵之间的关系,我们可以检测具有异常动态的毒维,将其重置为干净的预训练权重进行净化,随后在小规模干净数据集上微调净化后的权重。据我们所知,我们首次为安全或防御目的研究由扩散理论引导的动态过程。实验结果验证了即便使用小规模干净数据集 Fine-purifying 的有效性。

关键词

引用

@article{arxiv.2305.04547,
  title  = {Diffusion Theory as a Scalpel: Detecting and Purifying Poisonous Dimensions in Pre-trained Language Models Caused by Backdoor or Bias},
  author = {Zhiyuan Zhang and Deli Chen and Hao Zhou and Fandong Meng and Jie Zhou and Xu Sun},
  journal= {arXiv preprint arXiv:2305.04547},
  year   = {2023}
}

备注

Accepted by Findings of ACL 2023