中文

多复合推理:基于 token 级分支-合并的推理方法

计算与语言 2026-01-14 v1 人工智能 机器学习

摘要

大型语言模型在解决复杂推理任务时,通常通过链式思考(Chain-of-Thought, CoT)更有效,但代价是产生长而低带宽的 token 序列。相比之下,人类往往通过维持对合理后续步骤分布的软性推理来进行推理。为此,我们提出了多复合推理(Multiplex Thinking),一种随机软推理机制。在每一步思考中,它对 K 个候选 token 进行采样,并将其嵌入表示聚合为单个连续的多复合 token。这种方法保留了标准离散生成的词汇嵌入先验和采样动力学,同时在多复合序列上诱导出可计算的概率分布。因此,多复合轨迹可以直接通过基于 on-policy 强化学习(RL)进行优化。重要的是,多复合推理是自适应的:当模型把握信心时,多复合 token 接近离散,行为类似标准 CoT;当模型不确定时,它紧凑地表示多个合理的后续步骤,而不会增加序列长度。在具有挑战性的数学推理基准测试中,多复合推理在 Pass@1 至 Pass@1024 的所有指标上都 consistently 超过强大的离散 CoT 和 RL 基线,同时产生更短的序列。代码和模型 checkpoint 可在 https://github.com/GMLR-Penn/Multiplex-Thinking 查阅。

关键词

引用

@article{arxiv.2601.08808,
  title  = {Multiplex Thinking: Reasoning via Token-wise Branch-and-Merge},
  author = {Yao Tang and Li Dong and Yaru Hao and Qingxiu Dong and Furu Wei and Jiatao Gu},
  journal= {arXiv preprint arXiv:2601.08808},
  year   = {2026}
}

备注

21 pages. Code available at https://github.com/GMLR-Penn/Multiplex-Thinking