RSafe:激励主动推理以构建稳健和自适应的 LLM 安全措施
人工智能
2025-10-27 v3
摘要
尽管经过谨慎的安全对齐努力,大型语言模型 (LLM) 仍然表现出漏洞,给用户和社会构成重大风险。为了防止政策违规内容的风险,系统级别的通过外部监护模型进行的 moderation——这些模型旨在监控 LLM 的输入和输出并阻止潜在有害内容——已成为一种流行的缓解策略。现有的监护模型训练方法高度依赖大量的人工精选数据集,并在面对分布之外的威胁时(如新兴的有害类别或 jailbreak 攻击)时难以有效应对。为此,我们提出 RSafe,一种基于自适应推理的安全措施,通过政策引导的分步推理来分析输入内容的安全风险,从而提供在指定安全策略范围内的稳健保护。RSafe 在两个阶段运行:1) 引导推理,在该阶段它通过政策引导的分步推理分析输入内容的安全风险;2) 强化对齐,在该阶段,基于规则的强化学习优化其推理路径以与准确的安全预测保持一致。这种两阶段训练范式使 RSafe 能够内化安全原则,以在未见或对抗性安全违规情景中实现安全保护的泛化。推理期间,RSafe 接受用户指定的安全策略,以提供针对特定安全要求的增强安全措施。
引用
@article{arxiv.2506.07736,
title = {RSafe: Incentivizing proactive reasoning to build robust and adaptive LLM safeguards},
author = {Jingnan Zheng and Xiangtian Ji and Yijun Lu and Chenhang Cui and Weixiang Zhao and Gelei Deng and Zhenkai Liang and An Zhang and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2506.07736},
year = {2025}
}