中文

基于推理激活越狱与原则引导的对齐框架:面向大规模推理模型

人工智能 2026-01-01 v2 密码学与安全

摘要

大规模推理模型(LRMs)面临一种独特的安全漏洞:其内部推理链即使最终输出看起来良好,也可能生成有害内容。为解决这一被忽视的风险,我们首先提出一种新颖的攻击范式,通过具体化实现推理激活式越狱(RAJ),表明将恶意提示细化为更具体的形式可触发逐步逻辑推理,从而覆盖模型的安全协议。为系统性地缓解这一漏洞,我们进一步开发了一个用于构建高质量安全对齐数据集的可扩展框架。该框架首先利用RAJ攻击从LRMs中引导出具有挑战性的有害推理链,然后通过量身定制的原则引导对齐(PGA)机制将这些高风险轨迹转化为安全、建设性且具有教育意义的响应。随后,我们引入PGA数据集,包含我们方法验证的3989个样本。广泛的实验表明,使用PGA数据集对LRMs进行微调显著提升了模型的安全性,在多个越狱基准测试中实现最高可达29.5%的防御成功率。关键的是,我们的方法不仅能防御复杂的基于推理的攻击,还能保持甚至提升模型的通用推理能力。这项工作为面向推理密集型AI系统的安全对齐提供了可扩展且有效的路径,解决了安全性与功能性能之间的核心权衡。

关键词

引用

@article{arxiv.2508.12897,
  title  = {RAJ-PGA: Reasoning-Activated Jailbreak and Principle-Guided Alignment Framework for Large Reasoning Models},
  author = {Jianhao Chen and Mayi Xu and Haoyang Chen and Xiaohu Li and Xiangyu Zhang and Jianjie Huang and Zheng Wang and Xiaochun Cao and Tieyun Qian},
  journal= {arXiv preprint arXiv:2508.12897},
  year   = {2026}
}

备注

12 pages, 6 figures