原生并行推理器:通过自蒸馏强化学习实现并行推理
计算与语言
2026-05-15 v3
摘要
我们提出了原生并行推理器(NPR),一个无需教师的框架,使大语言模型(LLMs)能够自我进化出真正的并行推理能力。NPR 通过三项关键创新将模型从顺序模仿转变为原生并行认知:1)一种自蒸馏渐进训练范式,从冷启动格式发现过渡到严格拓扑约束,无需外部监督;2)一种新颖的并行感知策略优化(PAPO)算法,直接在执行图中优化分支策略,使模型能够通过试错学习自适应分解;3)一个稳健的 NPR 引擎,重构了 SGLang 的内存管理和流控制,以实现稳定的大规模并行强化学习训练。在八个推理基准上,以 Qwen3-4B 训练的 NPR 实现了高达 24.5% 的性能提升和高达 4.6 倍的推理加速。与通常回退到自回归解码的先前基线不同,NPR 展示了 100% 的真正并行执行,为自进化、高效且可扩展的智能体推理建立了新标准。
引用
@article{arxiv.2512.07461,
title = {Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning},
author = {Tong Wu and Yang Liu and Jun Bai and Zixia Jia and Shuyi Zhang and Ziyong Lin and Yanting Wang and Song-Chun Zhu and Zilong Zheng},
journal= {arXiv preprint arXiv:2512.07461},
year = {2026}
}