中文

AdvChain:对抗性思维链调谐以实现大型推理模型的鲁棒安全对齐

人工智能 2025-09-30 v1 计算与语言

摘要

大型推理模型(LRMs)通过思维链(CoT)推理在复杂问题求解中展现出显著能力。然而,CoT的多步特性引入了超越传统语言模型对齐的新安全挑战。我们识别出当前安全CoT调谐方法中的一种失效模式:雪球效应,即微小的推理偏差在思维过程中逐步放大,导致有害遵从或过度拒绝。这一效应源于模型被训练为模仿完美的推理脚本,而未学会自我纠正。为解决这一局限,我们提出AdvChain,一种通过对抗性CoT调谐教授模型动态自我纠正的对齐范式。我们的方法构建了包含诱惑-纠正与犹豫-纠正样本的数据集,使模型学会从有害推理漂移和不必要的谨慎中恢复。大量实验表明,AdvChain显著增强了对越狱攻击和CoT劫持的鲁棒性,同时大幅减少了对良性提示的过度拒绝,在不影响推理能力的前提下实现了更优的安全-效用平衡。我们的工作为构建更具鲁棒性和可靠性的推理模型开辟了新方向。

关键词

引用

@article{arxiv.2509.24269,
  title  = {AdvChain: Adversarial Chain-of-Thought Tuning for Robust Safety Alignment of Large Reasoning Models},
  author = {Zihao Zhu and Xinyu Wu and Gehan Hu and Siwei Lyu and Ke Xu and Baoyuan Wu},
  journal= {arXiv preprint arXiv:2509.24269},
  year   = {2025}
}