拒绝在崖底:推理中的安全对齐为何失败?
人工智能
2025-10-08 v1 密码学与安全
摘要
拥有多步骤推理能力的大型推理模型(LRM)已显示出惊人的解决问题能力,但它们表现出令人关切的安全漏洞,这些漏洞尚不受到充分理解。本文通过机制可解释性视角研究为什么安全对齐在推理模型中失败。我们采用线性探针方法追踪拒绝意图在 token 位置中的分布,发现一种称为 "拒绝崖" 的惊人现象:许多未对齐的推理模型在识别有害提示时正确地维持了强大的拒绝意图,但在生成输出的最终 token 之前经历了拒绝得分的尖锐下降。这表明这些模型本身并不不安全;相反,它们的拒绝意图被系统性地压制了。通过因果干预分析,我们识别出一小部分注意力头对拒绝行为有负面贡献。仅消融 3\% 的这些注意力头即可将攻击成功率降至 10\% 以下。基于这些机制见解,我们提出了一种新的数据选择方法,即 "以崖为裁判",用于识别表现出最大拒绝崖的训练示例,从而高效修复推理模型的安全对齐。该方法仅使用 vanilla 安全训练数据的 1.7\% 即可实现可 comparable 的安全改进,显示了安全对齐中的 less-is-more 效应。
引用
@article{arxiv.2510.06036,
title = {Refusal Falls off a Cliff: How Safety Alignment Fails in Reasoning?},
author = {Qingyu Yin and Chak Tou Leong and Linyi Yang and Wenxuan Huang and Wenjie Li and Xiting Wang and Jaehong Yoon and YunXing and XingYu and Jinjin Gu},
journal= {arXiv preprint arXiv:2510.06036},
year = {2025}
}