推理模型不仅思考得更久,它们的运动方式也不同
计算与语言
2026-05-18 v1 机器学习
机器学习
摘要
推理训练的语言模型常在更难的问题上消耗更多的 token,但更长的思考链并不显示模型是仅仅计算了更多步骤,还是遵循了不同的内部轨迹。我们通过对链式思考生成过程中隐藏状态轨迹进行研究,来区分这一区别,涵盖竞赛编程、数学和布尔可满足性问题。原始轨迹几何strongly受生成长度影响:更长的生成在机械性地改变路径统计数据,因此在没有长度校正的情况下,难度相关的比较是误导性的。在对长度进行残差化处理后,难度仍然在所有研究领域中都与校正后的轨迹几何系统性地耦合。最为清晰的推理特定分离出现在代码领域,较难的问题显示更直接的校正后轨迹,以及推理训练模型在推理训练模型中较少的本征局部曲率,而在匹配的指令微调基线中则更为异质。在数学和布尔可满足性领域,校正后的难度-几何耦合较弱,但仍然存在。提示阶段的线性探针并未反映代码领域的分离,行为注释显示,更强的校正耦合与策略转移和不确定性监控共现。总的来说,这些发现确立了在生成时间轨迹分析中进行长度校正作为必要前提,并表明推理训练可以与不同的校正后轨迹几何相关联,其中效果的强度取决于具体领域。
引用
@article{arxiv.2605.15454,
title = {Reasoning Models Don't Just Think Longer, They Move Differently},
author = {Anders Gjølbye and Lars Kai Hansen and Sanmi Koyejo},
journal= {arXiv preprint arXiv:2605.15454},
year = {2026}
}
备注
Preprint