中文

高效多LLM推理:LLM路由与层次化技术的特征化与分析

机器学习 2025-06-10 v1 人工智能 计算与语言 分布式、并行与集群计算

摘要

近期语言模型(LM)的进展在自然语言处理领域取得了显著进展,在文本生成、摘要和问答等任务中表现出色。然而,其推理仍计算密集且能耗高,尤其是在硬件、能源或带宽有限的环境中,使得在移动、边缘或成本敏感的环境中部署LM变得困难。为此,近期方法引入了多LLM智能模型选择策略,根据查询复杂度动态分配计算资源——为更简单的查询使用轻量级模型,仅在必要时升级到更大模型。本综述探讨了两种互补的高效LLM推理策略:(i)路由技术,根据查询选择最合适的模型;(ii)级联或层次化推理(HI),通过一系列模型逐步升级查询,直到找到足够自信的响应。两种方法旨在通过为更简单的任务使用轻量级模型来减少计算,仅在需要时进行资源升级。我们提供了这些技术在关键性能指标上的比较分析,讨论了 benchmarking 工作,概述了开放挑战。最后,我们勾勒了未来研究方向,以实现更快的响应时间、基于任务复杂度的自适应模型选择,以及在异构环境中的可扩展部署,使LLM-based系统更高效、更易于访问,适用于实际应用。

关键词

引用

@article{arxiv.2506.06579,
  title  = {Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques},
  author = {Adarsh Prasad Behera and Jaya Prakash Champati and Roberto Morabito and Sasu Tarkoma and James Gross},
  journal= {arXiv preprint arXiv:2506.06579},
  year   = {2025}
}