越狱抗体:通过稀疏表示调整实现大语言模型的运行时安全效用平衡
密码学与安全
2025-02-10 v4 计算与语言
摘要
随着大型语言模型 (LLM) 成为各类应用的核心,确保其安全性和实用性至关重要。越狱攻击通过操纵 LLM 生成有害内容,构成对这一平衡的重大挑战。现有防御措施,如提示工程和安全微调,常引入计算开销,增加推理延迟,且缺乏运行时灵活性。此外,过于严格的安全措施可能通过导致拒绝良性查询而降低模型实用性。本文引入 Jailbreak Antidote,一种方法enable 在推理期间通过操纵 LLM 内部状态的稀疏子集,实现对 LLM 安全偏好实时调整。通过沿安全方向移动模型隐藏表示并可变强度调整,实现对安全效用平衡的灵活控制,无需额外 token 开销或推理延迟。我们的分析表明,LLM 中的安全相关信息呈稀疏分布;约修改改 5% 的内部状态即可等效于修改整个状态。对九个 LLM(参数规模从 20 亿到 720 亿)进行广泛实验,评估十种越狱攻击方法并与六种防御策略比较,验证了该方法的有效性和效率。通过直接在推理期间操纵内部状态,Jailbreak Antidote 提供了一种轻量级、可扩展的解决方案,增强了 LLM 的安全性,同时保持实用性,为广泛部署的 AI 系统开辟了实时安全机制的新可能性。
引用
@article{arxiv.2410.02298,
title = {Jailbreak Antidote: Runtime Safety-Utility Balance via Sparse Representation Adjustment in Large Language Models},
author = {Guobin Shen and Dongcheng Zhao and Yiting Dong and Xiang He and Yi Zeng},
journal= {arXiv preprint arXiv:2410.02298},
year = {2025}
}
备注
Accepted by ICLR2025. url: https://openreview.net/forum?id=s20W12XTF8