中文

超越单一方向:链路思考破坏简单引导拒绝

人工智能 2026-05-27 v1

摘要

大型推理模型(LRM)在生成最终输出之前会生成链路思考(CoT)轨迹,引入动态的内部状态,可能使控制机制如拒绝变得更为复杂。与经过指令微调的大型语言模型不同,LRM 中的拒绝还取决于 CoT。在 DeepSeek-R1-Distill-LLaMA-8B 中,激活引导在固定 CoT 时仅有 39% 的情况能够逆转拒绝,但若完全移除 CoT,则比例提升至 70%,表明 CoT 实际上在强化拒绝。在一种两阶段干预中,当模型在激活引导下重新生成 CoT 时,拒绝的逆转率达到 94%,而生成的 CoT 本身即使在引导移除后,仍保留了 48% 的这种效果。这表明 CoT 能够独立地携带并重构合规信号。这一发现表明,LRM 中的拒绝同时编码于残差流激活和 CoT 之中。这种联合激活使得 LRM 在仅凭激活水平的干预下更具鲁棒性,但也暴露了 CoT 可能面临的另一种表面攻击。

关键词

引用

@article{arxiv.2605.26772,
  title  = {Beyond a Single Direction: Chain-of-Thought Disrupts Simple Steering of Refusal},
  author = {Kia-Jüng Yang and Dominik Meier and Jiachen Zhao and Terry Ruas and Bela Gipp},
  journal= {arXiv preprint arXiv:2605.26772},
  year   = {2026}
}