重新思考思考 Token:将 LLM 视为改进算子
机器学习
2025-10-02 v1 人工智能
摘要
推理训练激励大语言模型(LLM)产生长思维链(long CoT),这使其能够通过自我检查探索求解策略等。这提高了准确率,但也增加了上下文长度、token/计算成本和答案延迟。我们提出疑问:当前模型能否利用其元认知能力在该 Pareto 前沿上提供其他组合,例如在更低的上下文长度和/或延迟下获得更好的准确率?在抽象层面上,我们将模型视为对其自身“思想”进行操作的改进算子,具有连续的可能策略。我们识别出一个有趣的推理家族 Parallel-Distill-Refine(PDR),其执行以下操作: 并行生成多样化的草稿; 将其提炼到一个有界的文本工作空间中; 以该工作空间为条件进行优化,产生作为下一轮种子的输出。重要的是,上下文长度(进而计算成本)可通过并行度进行控制,不再与生成的总 token 数混为一谈。我们报告了当前模型的 PDR 实例,其在产生更低延迟的同时,比 long CoT 获得了更好的准确率。将并行度设为 1 会产生一个有趣的子情况,即顺序优化,它迭代地改进单个候选答案,其性能优于 long CoT。此类模型编排的成功引出了一个问题:进一步的训练能否改变 Pareto 前沿。为此,我们使用强化学习(RL)训练了一个 8B 思维模型,使其与作为推理方法的 PDR 保持一致。在具有可验证答案的数学任务上,迭代流水线在匹配的顺序预算下超越了单次基线,其中 PDR 带来的增益最大(例如,在 AIME 2024 上提升 11%,在 AIME 2025 上提升 9%)。
引用
@article{arxiv.2510.01123,
title = {Rethinking Thinking Tokens: LLMs as Improvement Operators},
author = {Lovish Madaan and Aniket Didolkar and Suchin Gururangan and John Quan and Ruan Silva and Ruslan Salakhutdinov and Manzil Zaheer and Sanjeev Arora and Anirudh Goyal},
journal= {arXiv preprint arXiv:2510.01123},
year = {2025}
}
备注
21 pages