塑造安全边界:理解和防御大语言模型中的越狱
计算与语言
2025-05-22 v2
摘要
大语言模型(LLMs)中的越狱是重大的安全问题,因为它可以欺骗LLMs生成有害文本。然而,人们仍不足够了解越狱的工作原理,这使得开发有效防御策略难以实现。我们旨在为此问题提供更多见解:我们对七种不同的越狱方法进行了详尽的大规模分析,发现这些差异源于观察样本不足。在特定方面,我们引入了“安全边界”概念,发现越狱会将有害激活置于安全边界之外,LLMs在该区域对有害信息不够敏感。我们还发现,低层和中层在此类偏移中至关重要,而更深的层则影响较小。基于这些见解,我们提出了一种新型防御方法,称为“激活边界防御”(ABD),该方法可适应性地约束安全边界内的激活。我们进一步使用贝叶斯优化 selectively 对低层和中层应用该防御方法。我们的实验在多个基准上表明,ABD对各种形式的越狱攻击可实现超过98%的平均 DSR,且对模型的通用能力影响不足2%。
引用
@article{arxiv.2412.17034,
title = {Shaping the Safety Boundaries: Understanding and Defending Against Jailbreaks in Large Language Models},
author = {Lang Gao and Jiahui Geng and Xiangliang Zhang and Preslav Nakov and Xiuying Chen},
journal= {arXiv preprint arXiv:2412.17034},
year = {2025}
}
备注
17 pages, 9 figures