中文

揭示微调攻击的不同机制:不一样的恶魔

计算与语言 2024-05-28 v1 密码学与安全

摘要

大型语言模型(LLM)的现有安全对齐方式fragile且可能通过不同策略轻易受到攻击,例如通过仅针对少量有害示例进行微调,或操控生成结果的前缀。然而,这些策略的攻击机制仍未得到充分探索。本文提出了一个核心问题:虽然这些方法都能显著削弱安全性能,但它们的攻击机制是否具有强大的相似性?为回答此问题,我们将 LLM 在面对有害指令时的保护过程分为三个阶段:(1)识别有害指令,(2)生成初始的拒绝语气,(3)完成拒绝响应。因此,我们探讨了不同攻击策略如何影响保护过程的各个阶段。我们利用诸如逻辑镜头和激活修补等技术,识别驱动特定行为的模型组件,并应用跨模型探测来检查攻击后的表示迁移。特别地,我们分析两种最具代表性的攻击方法:显式有害攻击(EHA)和身份转移攻击(ISA)。意外地,我们发现它们的攻击机制差异巨大。不同于 ISA,EHA 倾向于积极针对有害识别阶段发动攻击。尽管 EHA 和 ISA 都扰乱了后两个阶段,但它们的攻击程度和机制显著不同。我们的发现凸显了理解 LLM 内部保护过程的重要性,并表明需要多样化的防御机制才能有效应对各种类型的攻击。

关键词

引用

@article{arxiv.2405.16229,
  title  = {No Two Devils Alike: Unveiling Distinct Mechanisms of Fine-tuning Attacks},
  author = {Chak Tou Leong and Yi Cheng and Kaishuai Xu and Jian Wang and Hanlin Wang and Wenjie Li},
  journal= {arXiv preprint arXiv:2405.16229},
  year   = {2024}
}

备注

work in progress