中文

自引导防御:基于综合准则的推理模型自适应安全对齐框架

计算与语言 2026-01-06 v3 人工智能

摘要

推理模型在复杂推理任务中展现出惊人的能力,但确保其免受对抗性越狱提示的安全威胁仍是关键挑战。由于此类提示的隐蔽性和欺骗性,它们常常能规避内置的安全机制,导致有害内容的生成。这凸显了需要一种自适应安全对齐方法的需求,使模型能够针对对抗性输入自主强化其防御能力。本文引入了基于综合准则的自适应安全对齐 (Synthesized Guideline-based Adaptive Safety Alignment, SGASA) 框架,通过内化模型生成的安全准则来增强模型对抗有害对抗性提示的鲁棒性,同时最小化对良好请求的不必要拒绝。SGASA包含两个关键阶段:数据预综合,生成安全准则和增强提示;以及对齐微调,利用监督微调 (Supervised Fine-tuning, SFT) 和直接偏好优化 (Direct Preference Optimization, DPO) 将这些准则嵌入模型。多个数据集上的大量实验表明,SGASA显著提高了模型的安全性,验证了其自适应和可扩展性。

关键词

引用

@article{arxiv.2511.21214,
  title  = {Self-Guided Defense: Adaptive Safety Alignment for Reasoning Models via Synthesized Guidelines},
  author = {Yuhang Wang and Yanxu Zhu and Dongyuan Lu and Jitao Sang},
  journal= {arXiv preprint arXiv:2511.21214},
  year   = {2026}
}