揭示微调攻击的不同机制:不一样的恶魔
计算与语言
2024-05-28 v1 密码学与安全
摘要
大型语言模型(LLM)的现有安全对齐方式fragile且可能通过不同策略轻易受到攻击,例如通过仅针对少量有害示例进行微调,或操控生成结果的前缀。然而,这些策略的攻击机制仍未得到充分探索。本文提出了一个核心问题:虽然这些方法都能显著削弱安全性能,但它们的攻击机制是否具有强大的相似性?为回答此问题,我们将 LLM 在面对有害指令时的保护过程分为三个阶段:(1)识别有害指令,(2)生成初始的拒绝语气,(3)完成拒绝响应。因此,我们探讨了不同攻击策略如何影响保护过程的各个阶段。我们利用诸如逻辑镜头和激活修补等技术,识别驱动特定行为的模型组件,并应用跨模型探测来检查攻击后的表示迁移。特别地,我们分析两种最具代表性的攻击方法:显式有害攻击(EHA)和身份转移攻击(ISA)。意外地,我们发现它们的攻击机制差异巨大。不同于 ISA,EHA 倾向于积极针对有害识别阶段发动攻击。尽管 EHA 和 ISA 都扰乱了后两个阶段,但它们的攻击程度和机制显著不同。我们的发现凸显了理解 LLM 内部保护过程的重要性,并表明需要多样化的防御机制才能有效应对各种类型的攻击。
引用
@article{arxiv.2405.16229,
title = {No Two Devils Alike: Unveiling Distinct Mechanisms of Fine-tuning Attacks},
author = {Chak Tou Leong and Yi Cheng and Kaishuai Xu and Jian Wang and Hanlin Wang and Wenjie Li},
journal= {arXiv preprint arXiv:2405.16229},
year = {2024}
}
备注
work in progress