中文

PaCoRe:通过并行协调推理学习扩展测试时计算

机器学习 2026-01-12 v1

摘要

我们引入了并行协调推理(PaCoRe),这是一个训练与推理框架,旨在克服当代语言模型的一个核心局限:它们无法在固定上下文窗口下将测试时计算(TTC)扩展到远超顺序推理的程度。PaCoRe 通过多轮中经由消息传递架构协调的大规模并行探索来驱动 TTC,从而脱离了传统的顺序范式。每一轮启动许多并行推理轨迹,将其发现压缩为上下文有界的消息,并综合这些消息以指导下一轮并最终产生最终答案。通过大规模、基于结果的强化学习进行端到端训练,模型掌握了 PaCoRe 所需的综合能力,并在不超出上下文限制的情况下将有效 TTC 扩展到数百万令牌。该方法在多个领域带来了显著改进,尤其在数学推理方面超越了前沿系统:一个 8B 模型在 HMMT 2025 上达到了 94.5%,通过将有效 TTC 扩展到约两百万令牌,超越了 GPT-5 的 93.2%。我们开源了模型检查点、训练数据和完整的推理流程,以加速后续研究。

关键词

引用

@article{arxiv.2601.05593,
  title  = {PaCoRe: Learning to Scale Test-Time Compute with Parallel Coordinated Reasoning},
  author = {Jingcheng Hu and Yinmin Zhang and Shijie Shang and Xiaobo Yang and Yue Peng and Zhewei Huang and Hebin Zhou and Xin Wu and Jie Cheng and Fanqi Wan and Xiangwen Kong and Chengyuan Yao and Kaiwen Yan and Ailin Huang and Hongyu Zhou and Qi Han and Zheng Ge and Daxin Jiang and Xiangyu Zhang and Heung-Yeung Shum},
  journal= {arXiv preprint arXiv:2601.05593},
  year   = {2026}
}