不同路径导致有害合规:LLM 越狱中的行为副作用与机制性差异
密码学与安全
2026-04-21 v1 人工智能
计算与语言
摘要
开源语言模型可以通过多种不同的干预措施变得不安全,但这些结果模型在能力、行为轮廓和内部失效模式方面可能存在显著差异。我们研究了在三种不安全路径下被越狱模型的行为和机制属性:有害监督微调(SFT)、使用可验证奖励的有害强化学习(RLVR),以及抑制拒绝的削减。所有三种路径都实现了接近极限的有害合规,但一旦超越直接的有害性,结果就会出现分歧。RLVR 越狱的模型显示出最小的性能下降,保留了结构化自审计的显式危害识别能力:它们能够识别有害提示并描述安全 LLM 应如何响应,却仍遵循有害请求。对于 RLVR,强烈的反思性安全框架抑制了有害行为:当在有害提示前添加一条关于反思安全标准的指令时,有害行为接近基线水平。特定领域的 RLVR 越狱在有害性领域中具有广泛的普遍化能力。使用 SFT 的模型显示出显式安全判断的最大崩溃、最高的行为漂移,以及在标准基准测试上的显著能力损失。削减方式在自审和对反思性安全框架的响应方面具有家族依赖性。机制分析和修复分析进一步区分了这些路径:削减符合局部拒绝特征删除,RLVR 保留安全几何但重新定位策略行为,SFT 表现出更广泛的分布式漂移。针对性修复部分恢复了 RLVR 越狱模型,但对 SFT 越狱模型几乎无效。总之,这些结果表明,尽管有害性相似,越狱仍可产生截然不同的属性,而通过 RLVR 越狱的模型在保持与基础模型高度相似性方面表现突出。
引用
@article{arxiv.2604.18510,
title = {Different Paths to Harmful Compliance: Behavioral Side Effects and Mechanistic Divergence Across LLM Jailbreaks},
author = {Md Rysul Kabir and Zoran Tiganj},
journal= {arXiv preprint arXiv:2604.18510},
year = {2026}
}