RAPO:面向可泛化安全推理的风险感知偏好优化
机器学习
2026-02-05 v1 人工智能
计算与语言
密码学与安全
最优化与控制
摘要
大型推理模型(LRMs)凭借其链律思考(CoT)推理取得了显著进展,但也面临类似基础语言模型的安全问题。具体而言,虽然算法旨在引导它们针对有害提示进行拒绝,但在面对多样化且复杂的越狱攻击时,这一过程往往难以实现泛化。在本工作中,我们指出,这些失败归因于安全推理过程的泛化性,尤其是其对复杂攻击提示的鲁棒性不足。我们通过理论与实证证据,阐明针对高级攻击提示构建更完善安全推理过程的必要性。基于此洞见,我们提出了一种风险感知偏好优化(RAPO)框架,使LRM能够在其思考内容中以合适的粒度自适应地识别和应对安全风险。大量实验表明,RAPO成功地在多样化攻击提示下自适应地提升了多种LRM的安全推理能力,同时保持了通用实用性,为LRM的安全对齐贡献了一种稳健的技术方案。我们的代码已公开于 https://github.com/weizeming/RAPO。
引用
@article{arxiv.2602.04224,
title = {RAPO: Risk-Aware Preference Optimization for Generalizable Safe Reasoning},
author = {Zeming Wei and Qiaosheng Zhang and Xia Hu and Xingcheng Xu},
journal= {arXiv preprint arXiv:2602.04224},
year = {2026}
}