中文

思维火花!:后训练期间推理模型中涌现的注意力头

人工智能 2026-04-15 v2

摘要

现代大型推理模型的卓越能力主要通过监督微调和强化学习等后训练技术得以释放。然而,这些改进背后的架构机制在很大程度上仍不透明。在这项工作中,我们使用电路分析证明,针对复杂推理的后训练激发了功能特化的新型注意力头的涌现。这些头共同支持结构化推理和计算。我们对不同模型家族的比较分析揭示,这些涌现的头在不同的训练机制下演化方式不同。蒸馏和监督微调促进了稳定推理头的累积增加。相比之下,组相对策略优化则以动态搜索模式运行:相对较少的注意力头被迭代激活、评估和剪枝,其存活与否与任务奖励信号的波动密切相关。此外,我们发现可控的“思考开/关”模型并不拥有专用的“思考”头。相反,关闭显式推理会触发一组更广泛但效率更低的补偿性头。通过消融和定性分析,我们将这些电路层面的动态与一个关键的性能权衡联系起来:强化的头能够为困难问题提供复杂的解题策略,但也可能引入“过度思考”的失败模式,例如在更简单的任务上出现计算错误或逻辑循环。这些发现将电路层面的动态与宏观性能联系起来,识别出一种内在的张力,即复杂推理是以牺牲基本计算为代价的。更广泛地说,我们的工作为训练策略设计指明了未来方向,强调了在开发有效推理策略与确保可靠、无缺陷执行之间取得平衡的必要性。

关键词

引用

@article{arxiv.2509.25758,
  title  = {Thinking Sparks!: Emergent Attention Heads in Reasoning Models During Post Training},
  author = {Yein Park and Minbyul Jeong and Jaewoo Kang},
  journal= {arXiv preprint arXiv:2509.25758},
  year   = {2026}
}