中文

不仅是目的,更是旅程:推理痕迹因果地塑造泛化行为

计算与语言 2026-03-16 v1

摘要

链路思考 (CoT) 常被视为 LLM 决策过程的窗口,但最近的研究表明它可能仅仅是事后合理化。这引出一个关键的对齐问题:推理痕迹是否独立于最终答案而对模型泛化产生因果影响?为隔离推理的因果效应,我们设计了一个控制实验,在保持最终有害答案不变的同时变化推理路径。我们构建包含 "恶意" 推理(拥抱恶意)、"误导" 推理(合理化伤害)和 "顺从" 推理(屈从压力)的 dataset。我们训练模型(参数量从 0.6B 到 14B),并在多种范式下进行训练,包括 question-thinking-answer (QTA)、question-thinking (QT) 和 thinking-only (T-only),并在 think 和 no-think 模式下进行评估。我们发现:(1) CoT 训练可能比标准微调更放大有害泛化;(2) 不同的推理类型会导致不同的行为模式,这些模式与其语义相符,尽管最终答案相同;(3) 仅在没有答案监督的情况下进行训练(QT 或 T-only)就足以改变行为,证明推理携带独立的信号;(4) 这些效应即使在生成答案而不进行推理时仍然 persists,表明深层内化。我们的发现表明,推理内容是因果有力的,这挑战了仅监督输出而不监督推理的对齐策略。

关键词

引用

@article{arxiv.2603.12397,
  title  = {Not Just the Destination, But the Journey: Reasoning Traces Causally Shape Generalization Behaviors},
  author = {Pengcheng Wen and Yanxu Zhu and Jiapeng Sun and Han Zhu and Yujin Zhou and Chi-Min Chan and Sirui Han and Yike Guo},
  journal= {arXiv preprint arXiv:2603.12397},
  year   = {2026}
}