中文

Obliviate:在参数高效微调范式中中和任务无关后门

计算与语言 2024-10-08 v3 人工智能 密码学与安全 机器学习

摘要

参数高效微调(PEFT)已成为大语言模型的关键训练策略。然而,其对较少可训练参数的依赖带来了安全风险,例如任务无关后门。尽管任务无关后门对广泛任务具有严重影响,但目前尚无有效的实用防御方案能够在 PEFT 背景下有效应对此类后门。在本研究中,我们提出了 Obliviate,一种可集成于 PEFT 的后门防御方法。我们开发了两种技术,旨在放大 PEFT 层内的良性神经元并惩罚触发词的影响。我们在三种主要 PEFT 架构上的评估表明,我们的方法能显著降低最先进任务无关后门的攻击成功率(83.6%\downarrow)。此外,我们的方法对任务特定后门和自适应攻击均展现出稳健的防御能力。源代码可在 https://github.com/obliviateARR/Obliviate 获取。

关键词

引用

@article{arxiv.2409.14119,
  title  = {Obliviate: Neutralizing Task-agnostic Backdoors within the Parameter-efficient Fine-tuning Paradigm},
  author = {Jaehan Kim and Minkyoo Song and Seung Ho Na and Seungwon Shin},
  journal= {arXiv preprint arXiv:2409.14119},
  year   = {2024}
}

备注

Under Review