路由与推理:基于强化模型路由器扩展大语言模型推理能力
计算与语言
2025-12-05 v2 人工智能
摘要
链式思维已被证明对于增强大语言模型(LLM)的复杂推理能力至关重要,但也导致高计算成本。近期的研究探索了在多个模型之间路由查询的该方法,并证明其作为一种有前景的做法。然而,先前的工作直接在任务级别上操作,即分配用户查询给合适的 LLM,这并不允许混合 LLM 在更细粒度子任务上真正协作。对中间推理步骤(思考)进行协作,可能会实现更高效的协调,但也为路由调度带来了重大挑战,对路由器的质量要求极高,同时对任务分解的精度提出了巨大要求。为此,我们提出了 R2-Reasoner,一个围绕设计的强化模型路由器的新型框架,以有效扩展 LLM 推理。该路由器通过首先将复杂查询分解为子任务,然后将每个子任务分配给最佳模型来协调九个异构模型之间的合作,这些模型的参数规模范围从小于 10 亿到数千亿不等,既平衡了性能又平衡了成本。训练该路由器涉及分解器和分配器的两个阶段交替过程,集成监督微调与强化学习,以实现有效的自监督精炼。广泛的实验在六个具有挑战性的推理基准测试中表明,R2-Reasoner 在保持竞争性推理准确性的同时,将 API 成本降低了 84.46%。我们的框架为开发更可扩展和更高效的推理系统铺平了道路。我们的代码已开源于 https://anonymous.4open.science/r/R2_Reasoner。
引用
@article{arxiv.2506.05901,
title = {Route-and-Reason: Scaling Large Language Model Reasoning with Reinforced Model Router},
author = {Chenyang Shao and Xinyang Liu and Yutang Lin and Fengli Xu and Yong Li},
journal= {arXiv preprint arXiv:2506.05901},
year = {2025}
}