中文

信息泄露路径:LLM隐藏状态中判别力的消失助长越狱攻击

密码学与安全 2025-12-23 v2 人工智能

摘要

LLM 仍然容易受到越狱攻击,这类攻击利用对抗性提示来绕过安全措施。当前的安全微调方法面临两个关键局限。首先,它们通常无法在安全性和可用性之间取得平衡,更强的安全措施往往会导致过度拒绝无害的用户请求。其次,它们经常遗漏隐藏在看似良性任务中的恶意意图,使模型暴露于被利用的风险中。我们的工作识别了这些问题的一个根本原因:在响应生成过程中,LLM 区分有害输出与安全输出的能力会下降。实验证据证实了这一点,表明随着生成过程的推进,安全响应与有害响应之间隐藏状态的可分性逐渐减弱。这种判别力的减弱迫使模型在生成过程的早期就做出合规性判断,限制了其识别正在形成的恶意意图的能力,从而导致了上述两种失败。为了缓解这一漏洞,我们引入了 DEEPALIGN——一个增强 LLM 安全性的内在防御框架。通过在响应生成的中点应用对比隐藏状态引导,DEEPALIGN 放大了有害与良性隐藏状态之间的分离,从而在整个生成过程中实现连续的内在毒性检测与干预。在跨越不同架构和规模的多种 LLM 上,它将九种不同越狱攻击的攻击成功率降至接近零或极低水平。至关重要的是,它在降低过度拒绝的同时保留了模型能力。配备 DEEPALIGN 的模型在拒绝具有挑战性的良性查询时错误率降低了高达 3.5%,并保持了标准任务性能,降幅不到 1%。这标志着安全-可用性 Pareto 前沿的实质性进步。

关键词

引用

@article{arxiv.2503.11185,
  title  = {Bleeding Pathways: Vanishing Discriminability in LLM Hidden States Fuels Jailbreak Attacks},
  author = {Yingjie Zhang and Tong Liu and Zhe Zhao and Guozhu Meng and Kai Chen},
  journal= {arXiv preprint arXiv:2503.11185},
  year   = {2025}
}