中文

SAFEPATH:通过早期对齐防止链式思维中的有害推理

人工智能 2025-10-24 v4 计算与语言

摘要

大型推理模型 (LRM) 已成为复杂问题解决的强大工具,但其结构化推理路径在面对有害提示时可能导致不安全的输出。现有的安全对齐方法虽能减少有害输出,但会损害推理深度,在复杂的多步骤任务中导致显著的权衡,并且在面对高级 jailbreak 攻击时仍然脆弱。为此,我们引入 SAFEPATH,这是一种轻量级对齐方法,通过微调 LRM 在其推理开头发出短暂的 8 个 token 安全引言,以响应有害提示,同时保持其余推理过程的无监督。实验结果表明,SAFEPATH 在多个基准测试中有效降低有害输出,同时保持推理性能。具体而言,SAFEPATH 在 DeepSeek-R1-Distill-Llama-8B 模型中将有害响应降低最高可达 90.0%,并阻挡 83.3% 的 jailbreak 攻击,而计算资源仅为 Direct Refusal 的 295.9 倍且是 SafeChain 的 314.1 倍。我们进一步提供了一个无监督变体,无需微调。此外,我们对现有 LLM 方法在推理中心模型中的泛化性进行了全面分析,揭示了关键性缺口及新的更安全 AI 方向。

关键词

引用

@article{arxiv.2505.14667,
  title  = {SAFEPATH: Preventing Harmful Reasoning in Chain-of-Thought via Early Alignment},
  author = {Wonje Jeung and Sangyeon Yoon and Minsuk Kahng and Albert No},
  journal= {arXiv preprint arXiv:2505.14667},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025. Code and models are available at https://ai-isl.github.io/safepath