面向高效大语言模型推理的通用模型路由
计算与语言
2025-07-23 v2 机器学习
摘要
模型路由是一种降低大语言模型(LLM)推理成本的简单技术,其中维护一个候选LLM池,并学习将每个提示路由到最小的可行LLM。现有工作侧重于为固定的LLM池学习一个路由器。在本文中,我们考虑动态路由问题,即在测试时有新的、之前未见过的LLM可用。我们提出了UniRoute,一种解决此问题的新方法,该方法依赖于将每个LLM表示为一个特征向量,该向量基于对一组代表性提示的预测结果导出。在此基础上,我们详细介绍了UniRoute的两种有效实例化,分别依赖于基于聚类的路由和学习到的聚类映射。我们证明这些是对理论最优路由规则的估计,并通过超额风险界量化了它们的误差。在一系列公开基准上的实验表明了UniRoute在超过30个未见过的LLM之间进行路由的有效性。
引用
@article{arxiv.2502.08773,
title = {Universal Model Routing for Efficient LLM Inference},
author = {Wittawat Jitkrittum and Harikrishna Narasimhan and Ankit Singh Rawat and Jeevesh Juneja and Congchao Wang and Zifeng Wang and Alec Go and Chen-Yu Lee and Pradeep Shenoy and Rina Panigrahy and Aditya Krishna Menon and Sanjiv Kumar},
journal= {arXiv preprint arXiv:2502.08773},
year = {2025}
}