事半功倍:基于大语言模型系统中面向资源优化的路由策略综述
人工智能
2025-07-22 v3 计算与语言
摘要
基于大语言模型(LLM)的系统,即包含LLM作为核心组件的互联元素(如对话智能体),通常采用单一、静态的架构设计,依赖单个通用LLM来处理所有用户查询。然而,这些系统可能效率低下,因为不同的查询可能需要不同层次的推理、领域知识或预处理。虽然通用型LLM(如GPT-4o、Claude-Sonnet)在广泛的任务中表现良好,但它们可能产生显著的财务、能源和计算成本。对于较简单的查询,这些成本可能不成比例,导致不必要的资源利用。因此,可以采用路由机制将查询导向更合适的组件,例如更小或更专业的模型,从而提高效率并优化资源消耗。本综述旨在全面概述基于LLM系统中的路由策略。具体而言,它回顾了何时、为何以及如何将路由集成到LLM流水线中,以提高效率、可扩展性和性能。我们定义了要优化的目标,如成本最小化和性能最大化,并讨论了路由在LLM工作流中的时机,即发生在生成之前还是之后。我们还详细介绍了各种实现策略,包括基于相似度、监督学习、强化学习和生成式方法。此外,还审视了实际考虑因素,如工业应用和当前的局限性,例如标准化路由实验、考虑非财务成本以及设计自适应策略。通过将路由形式化为一个性能-成本优化问题,本综述为未来自适应低成本LLM系统的研究和发展提供了工具和方向。
引用
@article{arxiv.2502.00409,
title = {Doing More with Less: A Survey on Routing Strategies for Resource Optimisation in Large Language Model-Based Systems},
author = {Clovis Varangot-Reille and Christophe Bouvard and Antoine Gourru and Mathieu Ciancone and Marion Schaeffer and François Jacquenet},
journal= {arXiv preprint arXiv:2502.00409},
year = {2025}
}