HierRouter:基于强化学习的专用大型语言模型协调路由
计算与语言
2025-11-14 v1 机器学习
摘要
大型语言模型(LLM)在许多任务中展现出最先进的性能,但高昂的计算和内存成本限制了其在资源受限或实时场景中的部署。为解决此问题,我们提出 HierRouter,一种分层路由方法,可从一组专用的轻量级语言模型中动态组装推理流水线。该方法被建模为有限时域马尔可夫决策过程(MDP),训练一个基于近端策略优化(PPO)的强化学习智能体,以迭代选择在多跳推理的每个阶段调用哪些模型。该智能体根据不断变化的上下文和累积成本做出上下文感知的路由决策。在六个基准测试(包括问答、代码生成和数学推理)上使用三个开源候选 LLM 进行的实验表明,与单独使用单个模型相比,HierRouter 将响应质量提升了高达 2.4 倍,同时平均仅增加了极小的推理成本。这些结果凸显了分层路由在实现高性价比、高性能 LLM 推理方面的潜力。所有代码可在 https://github.com/Nikunj-Gupta/hierouter 获取。
引用
@article{arxiv.2511.09873,
title = {HierRouter: Coordinated Routing of Specialized Large Language Models via Reinforcement Learning},
author = {Nikunj Gupta and Bill Guo and Rajgopal Kannan and Viktor K. Prasanna},
journal= {arXiv preprint arXiv:2511.09873},
year = {2025}
}