X-Boundary:无需牺牲可用性即可为 LLM 建立精确安全边界以防御多轮越狱
密码学与安全
2025-12-29 v3 人工智能
计算与语言
计算机视觉与模式识别
机器学习
摘要
尽管 LLM 的安全对齐技术取得了快速发展,但防御多轮越狱仍然是一个具有挑战性的任务。本文进行了全面比较,揭示了一些现有防御方法虽然可以提高 LLM 对多轮越狱的鲁棒性,但会牺牲可用性,即降低一般能力或导致过度拒绝问题。从 LLM 可解释性的角度,我们发现这些方法未能建立一个恰好区分安全特征表示与有害特征表示的边界。因此,靠近有害特征表示的边界安全表示不可避免地被破坏,导致可用性下降。为此,我们提出了 X-Boundary,通过将有害特征表示推远离边界安全特征表示,从而获得精确的区分边界。如此一来,可以精确擦除有害特征表示,而不干扰安全特征表示。实验结果表明,X-Boundary 在防御多轮越狱方面实现了最新的防御性能,同时将过度拒绝率降低约 20%,并保持近乎完整的一般能力。 Furthermore, 我们理论上证明并经验上验证了 X-Boundary 能加速训练过程中的收敛。请参阅我们的代码:https://github.com/AI45Lab/X-Boundary。
引用
@article{arxiv.2502.09990,
title = {X-Boundary: Establishing Exact Safety Boundary to Shield LLMs from Multi-Turn Jailbreaks without Compromising Usability},
author = {Xiaoya Lu and Dongrui Liu and Yi Yu and Luxin Xu and Jing Shao},
journal= {arXiv preprint arXiv:2502.09990},
year = {2025}
}