中文

推理LLM的链积想法是否具有干预鲁棒性

人工智能 2026-02-10 v1

摘要

推理LLM(RLLMs)在给出答案之前会生成逐步的思维链(CoTs),这提高了复杂任务上的性能,并使推理更加透明。但这些推理痕迹是否对其中发生的干扰具有鲁棒性呢?为此,我们引入了一个受控评估框架,对模型自身CoT在固定时间步的进行扰动。我们设计了七种干预(良性、中性和对抗性),并将其应用于多个开源权重RLLMs,涵盖数学、科学和逻辑任务。我们的结果表明,RLLMs通常具有鲁棒性,能够可靠地从各种扰动中恢复,鲁棒性随模型大小而提高,在干预发生较早时会下降。然而,鲁棒性并非风格无关:改写会抑制类似怀疑的表达,并降低性能,而其他干预则会触发怀疑并支持恢复。恢复也会付出代价:中性和对抗性噪声可使CoT长度增加超过200%,而改写则缩短痕迹但损害准确性。这些发现为如何RLLMs维持推理完整性提供了新证据,识别怀疑作为核心恢复机制,并突出了鲁棒性与效率之间的权衡,表明未来的训练方法需要关注。

关键词

引用

@article{arxiv.2602.07470,
  title  = {Are Reasoning LLMs Robust to Interventions on Their Chain-of-Thought?},
  author = {Alexander von Recum and Leander Girrbach and Zeynep Akata},
  journal= {arXiv preprint arXiv:2602.07470},
  year   = {2026}
}

备注

ICLR 2026