中文

超越语义:无意义中间标记的惊人有效性

机器学习 2026-05-27 v4 人工智能

摘要

近期大规模推理模型取得的显著成果被解释为链式思考(CoT)的胜利,尤其是通过在训练中使用来自基础 LLM 的 CoT 样本以帮助发现新的推理模式。尽管这些痕迹 certainly 似乎有助于模型性能,但它们如何影响性能尚不明确,有些研究赋予其语义,而另一些研究则警告不要依赖它们作为模型内部计算过程的透明且可信的代理。为系统性地调查终端用户语义对推导痕迹的影响,我们设置了一个受控研究,在该研究中,我们从头开始训练 transformer 模型以在形式上可验证的推理痕迹及其引导的解决方案上进行训练。我们注意到,尽管在解决方案基线上取得了收益,但在训练正确痕迹的模型仍可能产生无效的推理痕迹,即使最终答案是正确的。更有趣的是,我们的实验还表明,在训练被破坏痕迹的模型时,尽管这些中间推理步骤与它们伴随的题目毫无关联,所得模型的表现与训练正确痕迹的模型相当,甚至在分布外任务上表现更好。我们还研究了基于 GRPO 的 RL 后训练对痕迹有效性的影响,注意到虽然解决方案准确率提高,但这并未伴随对痕迹有效性的改善。最后,我们检查推理痕迹长度是否反映推理时间扩展,发现痕迹长度对所解决问题的底层计算复杂度基本不敏感。这些结果挑战了中间标记或“链式思考”反映或诱导可预测推理行为的假设,警告不要将此类输出拟人化,或过度解读它们(尽管形式看起来似乎是人类或算法行为的证据)。

关键词

引用

@article{arxiv.2505.13775,
  title  = {Beyond Semantics: The Unreasonable Effectiveness of Reasonless Intermediate Tokens},
  author = {Karthik Valmeekam and Vardhan Palod and Kaya Stechly and Atharva Gundawar and Subbarao Kambhampati},
  journal= {arXiv preprint arXiv:2505.13775},
  year   = {2026}
}

备注

Published in Transactions on Machine Learning Research (TMLR)