当思考适得其反: 推理诱导失踪的机制性洞察
计算与语言
2026-03-11 v4
摘要
随着大语言模型的可及性和广泛采用,关于其安全性与人类价值观一致性的关注日益突出。本文识别出一种令人担忧的现象:推理诱导失踪(RIM),即在增强推理能力(特别是引入特定类型的推理模式)后,失踪仍然会出现。除报告这一漏洞外,我们提供了其起源的首个机制性解释。通过表征分析,我们发现特定注意力头通过减少对思维链(CoT)标记的注意来实现拒绝,这种机制在推理过程中调节模型的合理化过程。在训练过程中,我们发现与推理相关的神经元在安全关键神经元中的激活显著高于对照神经元,特别是在使用这些识别出的推理模式进行微调后。这一纠缠与灾难性遗忘强烈相关,提供了RIM的神经水平解释。
引用
@article{arxiv.2509.00544,
title = {When Thinking Backfires: Mechanistic Insights Into Reasoning-Induced Misalignment},
author = {Hanqi Yan and Hainiu Xu and Siya Qi and Shu Yang and Yulan He},
journal= {arXiv preprint arXiv:2509.00544},
year = {2026}
}
备注
ICLR 2026