Obliviate:在参数高效微调范式中中和任务无关后门
计算与语言
2024-10-08 v3 人工智能
密码学与安全
机器学习
摘要
参数高效微调(PEFT)已成为大语言模型的关键训练策略。然而,其对较少可训练参数的依赖带来了安全风险,例如任务无关后门。尽管任务无关后门对广泛任务具有严重影响,但目前尚无有效的实用防御方案能够在 PEFT 背景下有效应对此类后门。在本研究中,我们提出了 Obliviate,一种可集成于 PEFT 的后门防御方法。我们开发了两种技术,旨在放大 PEFT 层内的良性神经元并惩罚触发词的影响。我们在三种主要 PEFT 架构上的评估表明,我们的方法能显著降低最先进任务无关后门的攻击成功率(83.6%)。此外,我们的方法对任务特定后门和自适应攻击均展现出稳健的防御能力。源代码可在 https://github.com/obliviateARR/Obliviate 获取。
引用
@article{arxiv.2409.14119,
title = {Obliviate: Neutralizing Task-agnostic Backdoors within the Parameter-efficient Fine-tuning Paradigm},
author = {Jaehan Kim and Minkyoo Song and Seung Ho Na and Seungwon Shin},
journal= {arXiv preprint arXiv:2409.14119},
year = {2024}
}
备注
Under Review